ИИтак

← Назад

Модель · Mistral

Mistral Medium 3.5

Флагманская открытая модель Mistral для чата, программирования и агентов: рассуждения и код в одних весах

вышла 29 апреля

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

102 место из 266
индекс 141, вероятный разброс 139–143 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 59,1%
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 30,7%
Surface Evolver Bench16 задач: описать для физической программы Surface Evolver форму жидкости под действием поверхностного натяжения, гравитации и ограниченийЗасчитывается частичное выполнение: отдельные баллы за корректный файл, успешный прогон симуляции и совпадение объёма, площади и энергии с эталоном.Подробнее на английском ↗ 26,9%
FrontierCodeМодель исправляет проблему в открытом проекте, а правку оценивают по тому, приняли бы её сопровождающие проектаБалл выставляют по критериям сопровождающих и усредняют по пяти запускам; если нарушен хотя бы один обязательный критерий, за задачу ставят ноль.Подробнее на английском ↗ 8,0%
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 9,0%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 43,7%

Характеристики

Вышла
29 апреля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
262 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 262 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1,50 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$7,50 за миллион токенов
Понимает
текст, изображения
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
mistral-medium-2604

Что это за модель

Mistral Medium 3.5 — плотная модель на 128 млрд параметров. «Плотная» значит, что на каждый токен работают все веса сразу, а не часть «экспертов», как в моделях со смесью экспертов. Сама Mistral называет её своей первой флагманской «объединённой» моделью. Одни и те же веса выполняют инструкции, рассуждают и пишут код. Картинки она понимает через визуальный кодировщик, который обучили с нуля. Он принимает изображения разных размеров и пропорций.

Раньше в линейке Mistral под разные задачи были разные модели. Для программирования была отдельная Devstral 2, и теперь Medium 3.5 заменила её в роли агента в консольном инструменте Vibe CLI. Кроме того, она стала моделью по умолчанию в чат-боте Le Chat. Глубину рассуждений задают в каждом запросе: без рассуждений ради быстрого ответа или на высоком уровне для сложных задач. По замерам лаборатории, модель набирает 77,6% на SWE-Bench Verified (исправление реальных ошибок в коде) и 91,4 на τ³-Telecom (агентные задачи с вызовом инструментов).

Модель берут для долгих агентных задач, программирования, работы с изображениями и многоязычных ассистентов. На ней работают удалённые агенты для программирования в Vibe и новый режим Work в Le Chat. Этот режим выполняет многошаговые задачи: исследования и процессы, в которых задействовано несколько инструментов. Модель поддерживает вызов функций и ответы в формате JSON.

Веса открыты под изменённой лицензией MIT. Её можно применять в коммерческих и некоммерческих целях, но для компаний с очень большой выручкой есть ограничения. Чтобы запустить модель у себя, по словам Mistral, хватит четырёх видеокарт. Это меньше, чем нужно огромным моделям, но для домашнего компьютера всё равно слишком много. В рейтинге Epoch модель занимает место в середине списка, заметно ниже передовых моделей других лабораторий.

Источники: Анонс Mistral Medium 3.5 и удалённых агентов Vibe, Карточка модели на Hugging Face

Того же уровня по индексу Epoch

Другие модели семейства

Новости о модели

  1. 01

    Mistral выпустила Agentic Search: модель сама открывает документ и ищет нужную таблицу

    Mistral AI

все 1 новость о Medium 3.5 →

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).