Модель · Mistral
Mistral Small 4
Недорогая открытая модель Mistral для чата, кода и агентов, в которой соединены рассуждения, понимание картинок и программирование
вышла 16 марта
Характеристики
- Вышла
- 16 марта
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 256 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 256 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,15 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0,60 за миллион токенов
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- июнь 2025
- Идентификатор в API
- mistral-small-2603
Что это за модель
Mistral Small 4 — следующая модель в линейке Small. Она построена как смесь экспертов: внутри 128 подсетей-«экспертов», и на каждый токен работают только четыре из них. Всего в модели 119 млрд параметров, а на каждом шаге задействовано около 6 млрд. Поэтому она отвечает быстрее и обходится дешевле, чем плотная модель того же размера. Веса выложены под лицензией Apache 2.0, которая разрешает и коммерческое использование.
Главное отличие от прошлых версий в том, что Mistral соединила в одной модели три свои отдельные линейки. Раньше рассуждения делала Magistral, картинки понимала Pixtral, а агентным программированием занималась Devstral. Глубину рассуждений задаёт параметр reasoning_effort. При значении «none» модель отвечает быстро, как чат-модель Small 3.2. При значении «high» она рассуждает по шагам, как Magistral. По словам компании, по сравнению с Small 3 задержка ответа ниже на 40%, а запросов в секунду обрабатывается втрое больше.
Модель рассчитана на обычный чат, программирование, агентные задачи и сложные рассуждения. По замерам Mistral, в режиме рассуждений она не уступает GPT-OSS 120B или обходит её на трёх бенчмарках, но пишет заметно короче. На тесте AA LCR, который проверяет рассуждения по длинным текстам, она набирает 0,72 при ответах примерно в 1,6 тыс. знаков. Моделям Qwen для сопоставимого результата нужно 5,8–6,1 тыс. знаков. На LiveCodeBench, тесте по программированию, она обходит GPT-OSS 120B, а текста выдаёт на 20% меньше. Короткие ответы означают меньше платных токенов и меньше ожидания.
Название Small не значит, что модель поместится на домашний компьютер. Mistral называет минимальной конфигурацией четыре серверные NVIDIA HGX H100, две HGX H200 или одну DGX B200. Поэтому запускать её у себя имеет смысл компаниям с собственными серверами. Остальным проще подключаться через API.
Источники: Анонс Mistral Small 4 в блоге Mistral
Другие модели семейства
-
Mistral Small 3.2
Mistral145-е место в Epochконтекст 128 тыс.$0,10 / $0,30открытые веса
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).