ИИтак

← Назад

Модель · Mistral

Mistral Large 3

Крупнейшая открытая модель Mistral для чата, работы с документами, программирования и агентов, понимает картинки

вышла 1 ноября 2024

Характеристики

Вышла
1 ноября 2024
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
262 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 262 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,50 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$1,50 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
ноябрь 2024
Идентификатор в API
mistral-large-2512

Что это за модель

Mistral Large 3 — самая большая модель линейки Mistral 3, которую компания выпустила вместе с малыми моделями Ministral 3. Она устроена как смесь экспертов (mixture of experts): на каждый токен работает лишь часть сети. Всего в модели 675 млрд параметров, из них одновременно задействовано 41 млрд. Картинки она разбирает отдельным визуальным кодировщиком на 2,5 млрд параметров. По словам Mistral, модель обучили с нуля на 3000 видеокартах NVIDIA H200.

Для Mistral это первая модель со смесью экспертов со времён линейки Mixtral. Прежние версии Large были плотными: при ответе в них работали все параметры сразу. Компания заявляет, что по качеству Large 3 не уступает лучшим открытым моделям с дообучением под инструкции. На момент выхода она заняла второе место среди открытых моделей без режима рассуждений в рейтинге LMArena. Отдельно Mistral отмечает сильные результаты в разговорах на разных языках: модель поддерживает больше 40 языков.

Лаборатория советует брать модель для разбора длинных документов, как ассистента в чате, для сложных сценариев с вызовом инструментов, для корпоративной работы со знаниями и для программирования. Она умеет отвечать в заданном формате (структурированный ответ) и вызывать функции внешних программ, поэтому подходит для агентов — программ, которые сами выполняют задачи по шагам.

Сама Mistral называет три ограничения. Это не модель рассуждений: версию, которая «думает» перед ответом, компания обещала выпустить позже. С картинками она справляется хуже специализированных визуальных моделей. Запустить её у себя непросто: даже в сжатом формате FP8 нужен целый сервер с видеокартами H200 или B200. Веса открыты под лицензией Apache 2.0, она разрешает и коммерческое использование.

Источники: Анонс линейки Mistral 3, Документация Mistral Large 3, Карточка модели на Hugging Face

Другие модели семейства

Новости о модели

  1. 01

    Деланг: большие универсальные модели годами забирали «почти весь кислород» в ИИ

    Клеман Деланг

  2. 02

    NVIDIA собрала под маркой Halos всё, что нужно для сертификации беспилотников и роботов

    NVIDIA

  3. 03

    Две минуты вместо 45 дней: NVIDIA показала пять энергокомпаний, работающих на её ИИ

    NVIDIA

  4. 04

    Шесть копий за два дня: сообщество пытается повторить модель-«решалу» Jev

    Latent Space

  5. 05

    NVIDIA на примере Nemotron 3.5 Lightning объяснила, когда смесь экспертов лучше плотной модели

    NVIDIA для разработчиков

  6. 06

    NVIDIA в 10 раз ускорила обучение моделей-«смесей экспертов» на JAX

    NVIDIA для разработчиков

все 11 новостей о Large 3 →

Данные: models.dev (MIT).