ИИтак

← Назад

Модель · Mistral

Mistral Small 4

Недорогая открытая модель Mistral для чата, кода и агентов, в которой соединены рассуждения, понимание картинок и программирование

вышла 16 марта

Характеристики

Вышла
16 марта
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
256 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 256 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,15 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,60 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
июнь 2025
Идентификатор в API
mistral-small-2603

Что это за модель

Mistral Small 4 — следующая модель в линейке Small. Она построена как смесь экспертов: внутри 128 подсетей-«экспертов», и на каждый токен работают только четыре из них. Всего в модели 119 млрд параметров, а на каждом шаге задействовано около 6 млрд. Поэтому она отвечает быстрее и обходится дешевле, чем плотная модель того же размера. Веса выложены под лицензией Apache 2.0, которая разрешает и коммерческое использование.

Главное отличие от прошлых версий в том, что Mistral соединила в одной модели три свои отдельные линейки. Раньше рассуждения делала Magistral, картинки понимала Pixtral, а агентным программированием занималась Devstral. Глубину рассуждений задаёт параметр reasoning_effort. При значении «none» модель отвечает быстро, как чат-модель Small 3.2. При значении «high» она рассуждает по шагам, как Magistral. По словам компании, по сравнению с Small 3 задержка ответа ниже на 40%, а запросов в секунду обрабатывается втрое больше.

Модель рассчитана на обычный чат, программирование, агентные задачи и сложные рассуждения. По замерам Mistral, в режиме рассуждений она не уступает GPT-OSS 120B или обходит её на трёх бенчмарках, но пишет заметно короче. На тесте AA LCR, который проверяет рассуждения по длинным текстам, она набирает 0,72 при ответах примерно в 1,6 тыс. знаков. Моделям Qwen для сопоставимого результата нужно 5,8–6,1 тыс. знаков. На LiveCodeBench, тесте по программированию, она обходит GPT-OSS 120B, а текста выдаёт на 20% меньше. Короткие ответы означают меньше платных токенов и меньше ожидания.

Название Small не значит, что модель поместится на домашний компьютер. Mistral называет минимальной конфигурацией четыре серверные NVIDIA HGX H100, две HGX H200 или одну DGX B200. Поэтому запускать её у себя имеет смысл компаниям с собственными серверами. Остальным проще подключаться через API.

Источники: Анонс Mistral Small 4 в блоге Mistral

Другие модели семейства

Новости о модели

  1. 01

    Стартап TypeSafe выпустил Jev — модель, которая не пишет текст, а только принимает решения

    Latent Space

  2. 02

    NVIDIA на примере Nemotron 3.5 Lightning объяснила, когда смесь экспертов лучше плотной модели

    NVIDIA для разработчиков

  3. 03

    Cohere выпустила открытую модель-переводчик North Small Translate: по её тестам она обходит DeepL и Google

    Cohere

  4. 04

    DeepSeek выпустила V4.1-Flash и отключает свой флагман V4-Pro: младшая модель оказалась лучше

    DeepSeek

  5. 05

    Cohere советует компаниям не звать большую модель туда, где справится малая

    Cohere

  6. 06

    Microsoft открыла Orchard — общую инфраструктуру для обучения небольших ИИ-агентов

    Microsoft Research

все 6 новостей о Small 4 →

Данные: models.dev (MIT).