Модель · MiniMax
MiniMax-M3
Флагманская открытая модель MiniMax для программирования и агентов, понимает картинки и видео и работает с очень длинными текстами
вышла 1 июня
Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗
65 место из 266
индекс 146, вероятный разброс 143–150 · весь рейтинг →
| Бенчмарк | РезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию теста | УсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен |
|---|---|---|
| DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ | 64,9% | |
| LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ | 39,6% | |
| Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ | 0,0% | |
| OSWorld 2.0Долгие задачи на настоящем компьютере в десктопных и веб-приложениях; у человека уходит около 1,6 часа на задачуЗадача оценивается по многим взвешенным контрольным точкам, поэтому засчитывается и частичное выполнение.Подробнее на английском ↗ | 4,6% | |
| Surface Evolver Bench16 задач: описать для физической программы Surface Evolver форму жидкости под действием поверхностного натяжения, гравитации и ограниченийЗасчитывается частичное выполнение: отдельные баллы за корректный файл, успешный прогон симуляции и совпадение объёма, площади и энергии с эталоном.Подробнее на английском ↗ | 55,0% | |
| FrontierCodeМодель исправляет проблему в открытом проекте, а правку оценивают по тому, приняли бы её сопровождающие проектаБалл выставляют по критериям сопровождающих и усредняют по пяти запускам; если нарушен хотя бы один обязательный критерий, за задачу ставят ноль.Подробнее на английском ↗ | 14,7% | |
| ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ | 18,0% | |
| Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ | 9,5% | |
| OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ | 71,1% | |
| SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ | 35,0% | |
| GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ | 87,9% |
Характеристики
- Вышла
- 1 июня
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 1 млн токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 512 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,30 за миллион токенов
- Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
- $0,06 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $1,20 за миллион токенов
- Понимает
- текст, изображения, видео
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- MiniMax-M3
Что это за модель
MiniMax-M3 — флагманская модель шанхайской лаборатории MiniMax с открытыми весами. Она построена по схеме смеси экспертов (mixture of experts): всего в ней около 428 млрд параметров, но на каждый токен работают только около 23 млрд. Главная новинка — собственный механизм внимания MSA (MiniMax Sparse Attention). Это разреженное внимание: модель смотрит не на весь текст сразу, а на отобранные части, поэтому длинный контекст обходится дешевле.
По данным лаборатории, на контексте в миллион токенов M3 тратит на каждый токен примерно в 20 раз меньше вычислений, чем прошлое поколение. Чтение запроса ускорилось в 9 раз, генерация ответа — в 15 раз. В отличие от предыдущих моделей линейки M2, которые работали только с текстом, M3 с самого начала обучения видела вперемешку текст, картинки и видео. Поэтому она понимает изображения и ролики без отдельного модуля.
Модель берут прежде всего для программирования и агентных задач, где она сама выполняет длинную цепочку действий. По замерам MiniMax, она набирает 59% в SWE-Bench Pro, 80,5% в SWE-bench Verified и 66% в Terminal-Bench 2.1. Компания заявляет, что по программированию M3 приближается к ведущим закрытым моделям. В примерах из анонса она сутки оптимизировала вычислительные ядра для видеокарт и воспроизводила научные статьи по тексту и рисункам. Режим рассуждений можно включить всегда, отдать на выбор модели или выключить ради быстрого ответа.
Веса выложены под собственной лицензией MiniMax Community License. Если продукт на основе модели приносит больше 20 млн долларов выручки в год, нужно отдельное письменное разрешение MiniMax. Для остальных достаточно один раз уведомить компанию. Запускать модель у себя непросто: при таком размере ей нужен сервер с несколькими мощными видеокартами.
Источники: Анонс MiniMax M3 в блоге лаборатории, Карточка модели на Hugging Face
Того же уровня по индексу Epoch
-
Qwen3.6 27B
Qwen64-е место в Epochконтекст 262 тыс.$0,60 / $3,60открытые весарассуждениядороже в 3 раза
-
MiniMax-M2.5
MiniMax63-е место в Epochконтекст 204 тыс.$0,30 / $1,20открытые весарассуждения
-
Qwen3.5 Plus
Qwen62-е место в Epochконтекст 1 млн$0,40 / $2,40рассуждениядороже в 2 раза
-
DeepSeek V4 Flash
DeepSeek69-е место в Epochконтекст 1 млн$0,15 / $0,60открытые весарассуждениядешевле в 2 раза
Другие модели семейства
-
MiniMax-M2.7
MiniMax72-е место в Epochконтекст 204 тыс.$0,30 / $1,20открытые весарассуждения
-
MiniMax-M2.7-highspeed
MiniMaxконтекст 204 тыс.$0,60 / $2,40открытые весарассуждения
-
MiniMax-M2.5-highspeed
MiniMaxконтекст 204 тыс.$0,60 / $2,40открытые весарассуждения
-
MiniMax-M2.5
MiniMax63-е место в Epochконтекст 204 тыс.$0,30 / $1,20открытые весарассуждения
-
MiniMax-M2.1
MiniMaxконтекст 204 тыс.$0,30 / $1,20открытые весарассуждения
-
MiniMax-M2
MiniMaxконтекст 204 тыс.$0,30 / $1,20открытые весарассуждения
Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).