Модель · Mistral
Mistral Large 3
Крупнейшая открытая модель Mistral для чата, работы с документами, программирования и агентов, понимает картинки
вышла 1 ноября 2024
Характеристики
- Вышла
- 1 ноября 2024
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 262 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 262 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,50 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $1,50 за миллион токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- ноябрь 2024
- Идентификатор в API
- mistral-large-2512
Что это за модель
Mistral Large 3 — самая большая модель линейки Mistral 3, которую компания выпустила вместе с малыми моделями Ministral 3. Она устроена как смесь экспертов (mixture of experts): на каждый токен работает лишь часть сети. Всего в модели 675 млрд параметров, из них одновременно задействовано 41 млрд. Картинки она разбирает отдельным визуальным кодировщиком на 2,5 млрд параметров. По словам Mistral, модель обучили с нуля на 3000 видеокартах NVIDIA H200.
Для Mistral это первая модель со смесью экспертов со времён линейки Mixtral. Прежние версии Large были плотными: при ответе в них работали все параметры сразу. Компания заявляет, что по качеству Large 3 не уступает лучшим открытым моделям с дообучением под инструкции. На момент выхода она заняла второе место среди открытых моделей без режима рассуждений в рейтинге LMArena. Отдельно Mistral отмечает сильные результаты в разговорах на разных языках: модель поддерживает больше 40 языков.
Лаборатория советует брать модель для разбора длинных документов, как ассистента в чате, для сложных сценариев с вызовом инструментов, для корпоративной работы со знаниями и для программирования. Она умеет отвечать в заданном формате (структурированный ответ) и вызывать функции внешних программ, поэтому подходит для агентов — программ, которые сами выполняют задачи по шагам.
Сама Mistral называет три ограничения. Это не модель рассуждений: версию, которая «думает» перед ответом, компания обещала выпустить позже. С картинками она справляется хуже специализированных визуальных моделей. Запустить её у себя непросто: даже в сжатом формате FP8 нужен целый сервер с видеокартами H200 или B200. Веса открыты под лицензией Apache 2.0, она разрешает и коммерческое использование.
Источники: Анонс линейки Mistral 3, Документация Mistral Large 3, Карточка модели на Hugging Face
Другие модели семейства
-
Mistral Large 2.1
Mistral161-е место в Epochконтекст 131 тыс.$2 / $6открытые веса
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).