ИИтак

← Назад

Модель · Mistral

Pixtral 12B

Открытая модель Mistral, которая понимает картинки и документы; первая в линейке, теперь устаревшая

вышла 1 сентября 2024

Характеристики

Вышла
1 сентября 2024
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
128 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 128 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,15 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,15 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
сентябрь 2024
Идентификатор в API
pixtral-12b

Что это за модель

Pixtral 12B — первая мультимодальная модель Mistral: она принимает текст и изображения, а отвечает текстом. Она состоит из двух частей. Первая — визуальный кодировщик на 400 млн параметров, который лаборатория обучила с нуля. Вторая — языковая часть на 12 млрд параметров, построенная на Mistral Nemo.

Картинки модель берёт в исходном разрешении и с исходными пропорциями, без сжатия до одного размера. Кодировщик режет изображение на квадраты 16×16 пикселей и превращает каждый в токен. Служебные метки отмечают концы строк и конец картинки, поэтому модель различает пропорции снимков. В один запрос можно положить сколько угодно изображений, пока они помещаются в контекстное окно.

Модель берут, чтобы разбирать документы, диаграммы, графики и снимки экрана и отвечать на вопросы по ним. По замерам Mistral, она набирает 52,5% в MMMU, 58% в MathVista, 81,8% в ChartQA и 90,7% в DocVQA. Компания заявляет, что Pixtral 12B обходит открытые модели LLaVA-OneVision 7B и Qwen2-VL 7B, а в большинстве тестов на картинки не уступает Claude 3 Haiku. С текстом она, по словам лаборатории, справляется не хуже: в тестах на следование инструкциям IF-Eval и MT-Bench она на 20% лучше сопоставимых открытых моделей.

Веса выложены под лицензией Apache 2.0, поэтому модель можно запускать у себя и использовать в коммерческих продуктах. Сама Mistral пометила Pixtral 12B как устаревшую: её сменили более новые модели лаборатории, которые тоже понимают изображения.

Источники: Анонс Pixtral 12B в блоге Mistral

Данные: models.dev (MIT).