Модель · MiniMax
MiniMax-M2.5
Устаревшая открытая модель MiniMax для программирования, агентов и офисных задач, её сменили M2.7 и M3
вышла 12 февраля
Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗
63 место из 266
индекс 147, вероятный разброс 139–148 · весь рейтинг →
| Бенчмарк | РезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию теста | УсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен |
|---|---|---|
| CL-bench LifeЗадачи, которые решаются только по данным из запроса: групповые чаты, личные заметки, истории покупок и браузераПодробнее на английском ↗ | 6,3% | |
| CL-benchУмение выучить новое прямо из длинного текста: вымышленные законы, языки программирования, правила — и решить по ним задачиЗадача засчитывается, только если ответ проходит все проверочные критерии экспертов, поэтому даже лидеры решают около четверти.Подробнее на английском ↗ | 11,4% | |
| ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ | 4,0% | |
| APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ | 6,2% | |
| Terminal BenchЗадачи в командной строке по мотивам реальной работы: агент сам выполняет их в терминале, результат проверяют автотестыПодробнее на английском ↗ | 42,7% | |
| ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ | 4,9% | |
| ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ | 63,7% |
Характеристики
- Вышла
- 12 февраля
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 204 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 131 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,30 за миллион токенов
- Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
- $0,03 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $1,20 за миллион токенов
- Понимает
- текст
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- MiniMax-M2.5
Что это за модель
MiniMax-M2.5 — третья модель линейки M2 китайской компании MiniMax. Вышла она через три с половиной месяца после первой M2. Модель построена по схеме «смесь экспертов»: на каждый токен работает только часть сети. Всего в ней 229 млрд параметров. MiniMax обучала её с подкреплением (обучение на пробах и ошибках с оценкой результата) в сотнях тысяч рабочих сред. Для этого компания сделала собственный фреймворк Forge.
По сравнению с M2.1 компания обещает скорость и экономию. По её замерам, задачи SWE-Bench Verified M2.5 решает на 37% быстрее: 22,8 минуты против 31,3. Токенов на задачу она тратит немного меньше, а при поиске делает примерно на 20% меньше шагов. Результаты по замерам лаборатории: 80,2% на SWE-Bench Verified, 51,3% на Multi-SWE-Bench и 76,3% на BrowseComp (последний — с управлением контекстом). В бенчмарке VIBE-Pro, по словам MiniMax, модель держится на уровне Claude Opus 4.5. Одновременно вышла M2.5-Lightning, в API она называется M2.5-highspeed: вдвое быстрее, но выход у неё дороже.
Модель делали прежде всего для программирования и агентных процессов, где она сама выполняет многошаговые задачи с инструментами. Компания пишет, что перед написанием кода модель сама составляет план: функции, структуру, интерфейс. Её учили работать на десятке с лишним языков, среди них Python, Go, C++, Rust, TypeScript и Kotlin. Второе направление — офисная работа: документы Word, презентации PowerPoint и таблицы Excel, включая финансовые модели. По словам MiniMax, внутри компании M2.5 выполняет 30% задач и пишет 80% нового кода.
Веса открыты под изменённой лицензией MIT и лежат на Hugging Face. Запускать их можно через SGLang, vLLM, Transformers и KTransformers. Но при 229 млрд параметров обычной видеокарты не хватит. Сейчас модель считается предыдущим поколением: MiniMax уже выпустила M2.7 и M3.
Источники: Анонс MiniMax M2.5, Карточка модели на Hugging Face
Того же уровня по индексу Epoch
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждениядороже в 3 раза
-
MiniMax-M3
MiniMax65-е место в Epochконтекст 1 млн$0,30 / $1,20открытые весарассуждения
-
Qwen3.5 Plus
Qwen62-е место в Epochконтекст 1 млн$0,40 / $2,40рассуждениядороже в 2 раза
-
Claude Sonnet 4.5
Anthropic61-е место в Epochконтекст 1 млн$3 / $15рассуждениядороже в 13 раз
Другие модели семейства
-
MiniMax-M3
MiniMax65-е место в Epochконтекст 1 млн$0,30 / $1,20открытые весарассуждения
-
MiniMax-M2.7
MiniMax72-е место в Epochконтекст 204 тыс.$0,30 / $1,20открытые весарассуждения
-
MiniMax-M2.7-highspeed
MiniMaxконтекст 204 тыс.$0,60 / $2,40открытые весарассуждения
-
MiniMax-M2.5-highspeed
MiniMaxконтекст 204 тыс.$0,60 / $2,40открытые весарассуждения
-
MiniMax-M2.1
MiniMaxконтекст 204 тыс.$0,30 / $1,20открытые весарассуждения
-
MiniMax-M2
MiniMaxконтекст 204 тыс.$0,30 / $1,20открытые весарассуждения
Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).