ИИтак

← Назад

Модель · MiniMax

MiniMax-M2.5

Устаревшая открытая модель MiniMax для программирования, агентов и офисных задач, её сменили M2.7 и M3

вышла 12 февраля

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

63 место из 266
индекс 147, вероятный разброс 139–148 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
CL-bench LifeЗадачи, которые решаются только по данным из запроса: групповые чаты, личные заметки, истории покупок и браузераПодробнее на английском ↗ 6,3%
CL-benchУмение выучить новое прямо из длинного текста: вымышленные законы, языки программирования, правила — и решить по ним задачиЗадача засчитывается, только если ответ проходит все проверочные критерии экспертов, поэтому даже лидеры решают около четверти.Подробнее на английском ↗ 11,4%
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 4,0%
APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ 6,2%
Terminal BenchЗадачи в командной строке по мотивам реальной работы: агент сам выполняет их в терминале, результат проверяют автотестыПодробнее на английском ↗ 42,7%
ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ 4,9%
ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ 63,7%

Характеристики

Вышла
12 февраля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
204 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 131 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,30 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,03 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$1,20 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
MiniMax-M2.5

Что это за модель

MiniMax-M2.5 — третья модель линейки M2 китайской компании MiniMax. Вышла она через три с половиной месяца после первой M2. Модель построена по схеме «смесь экспертов»: на каждый токен работает только часть сети. Всего в ней 229 млрд параметров. MiniMax обучала её с подкреплением (обучение на пробах и ошибках с оценкой результата) в сотнях тысяч рабочих сред. Для этого компания сделала собственный фреймворк Forge.

По сравнению с M2.1 компания обещает скорость и экономию. По её замерам, задачи SWE-Bench Verified M2.5 решает на 37% быстрее: 22,8 минуты против 31,3. Токенов на задачу она тратит немного меньше, а при поиске делает примерно на 20% меньше шагов. Результаты по замерам лаборатории: 80,2% на SWE-Bench Verified, 51,3% на Multi-SWE-Bench и 76,3% на BrowseComp (последний — с управлением контекстом). В бенчмарке VIBE-Pro, по словам MiniMax, модель держится на уровне Claude Opus 4.5. Одновременно вышла M2.5-Lightning, в API она называется M2.5-highspeed: вдвое быстрее, но выход у неё дороже.

Модель делали прежде всего для программирования и агентных процессов, где она сама выполняет многошаговые задачи с инструментами. Компания пишет, что перед написанием кода модель сама составляет план: функции, структуру, интерфейс. Её учили работать на десятке с лишним языков, среди них Python, Go, C++, Rust, TypeScript и Kotlin. Второе направление — офисная работа: документы Word, презентации PowerPoint и таблицы Excel, включая финансовые модели. По словам MiniMax, внутри компании M2.5 выполняет 30% задач и пишет 80% нового кода.

Веса открыты под изменённой лицензией MIT и лежат на Hugging Face. Запускать их можно через SGLang, vLLM, Transformers и KTransformers. Но при 229 млрд параметров обычной видеокарты не хватит. Сейчас модель считается предыдущим поколением: MiniMax уже выпустила M2.7 и M3.

Источники: Анонс MiniMax M2.5, Карточка модели на Hugging Face

Того же уровня по индексу Epoch

Другие модели семейства

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).