Модель · Mistral
Pixtral 12B
Открытая модель Mistral, которая понимает картинки и документы; первая в линейке, теперь устаревшая
вышла 1 сентября 2024
Характеристики
- Вышла
- 1 сентября 2024
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 128 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 128 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,15 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0,15 за миллион токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- сентябрь 2024
- Идентификатор в API
- pixtral-12b
Что это за модель
Pixtral 12B — первая мультимодальная модель Mistral: она принимает текст и изображения, а отвечает текстом. Она состоит из двух частей. Первая — визуальный кодировщик на 400 млн параметров, который лаборатория обучила с нуля. Вторая — языковая часть на 12 млрд параметров, построенная на Mistral Nemo.
Картинки модель берёт в исходном разрешении и с исходными пропорциями, без сжатия до одного размера. Кодировщик режет изображение на квадраты 16×16 пикселей и превращает каждый в токен. Служебные метки отмечают концы строк и конец картинки, поэтому модель различает пропорции снимков. В один запрос можно положить сколько угодно изображений, пока они помещаются в контекстное окно.
Модель берут, чтобы разбирать документы, диаграммы, графики и снимки экрана и отвечать на вопросы по ним. По замерам Mistral, она набирает 52,5% в MMMU, 58% в MathVista, 81,8% в ChartQA и 90,7% в DocVQA. Компания заявляет, что Pixtral 12B обходит открытые модели LLaVA-OneVision 7B и Qwen2-VL 7B, а в большинстве тестов на картинки не уступает Claude 3 Haiku. С текстом она, по словам лаборатории, справляется не хуже: в тестах на следование инструкциям IF-Eval и MT-Bench она на 20% лучше сопоставимых открытых моделей.
Веса выложены под лицензией Apache 2.0, поэтому модель можно запускать у себя и использовать в коммерческих продуктах. Сама Mistral пометила Pixtral 12B как устаревшую: её сменили более новые модели лаборатории, которые тоже понимают изображения.
Источники: Анонс Pixtral 12B в блоге Mistral
Данные: models.dev (MIT).