ИИтак

← Назад

Модель · MiniMax

MiniMax-M2.7

Недорогая открытая модель MiniMax для программирования, агентов и офисных документов, бывший флагман, которого уже сменила M3

вышла 18 марта

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

72 место из 266
индекс 146, вероятный разброс 139–148 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
ExploitBenchНаписание эксплойтов для 41 реальной уязвимости движка V8 — от вызова сбоя до выполнения произвольного кодаВзлом разбит на 16 ступеней, и засчитываются промежуточные, так что балл не равен доле полностью взломанных уязвимостей.Подробнее на английском ↗ 13,3%
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 3,0%
Terminal BenchЗадачи в командной строке по мотивам реальной работы: агент сам выполняет их в терминале, результат проверяют автотестыПодробнее на английском ↗ 45,1%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 37,0%

Характеристики

Вышла
18 марта
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
204 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 131 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,30 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,06 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$1,20 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
MiniMax-M2.7

Что это за модель

MiniMax-M2.7 — языковая модель китайской компании MiniMax для агентных задач, то есть для работы, где модель сама планирует шаги и вызывает инструменты. Она построена как разреженная смесь экспертов (mixture of experts): всего около 229 млрд параметров, но на каждый токен срабатывает лишь малая их часть. Поэтому модель стоит недорого для своего размера. На момент выхода она была флагманом лаборатории, позже её сменила MiniMax-M3.

Главная идея релиза — модель, которая участвует в собственном развитии. В MiniMax исследователи обсуждали с ней идеи экспериментов, а M2.7 сама искала литературу, готовила данные, следила за запусками и чинила код. По словам компании, модель разбирала неудачные попытки, правила код своей среды запуска и перезапускала оценки. Так она прибавила около 30% на внутренних тестах. По сравнению с M2.5 лаборатория выделяет многошаговую правку документов, работу команд из нескольких агентов и более точное следование навыкам: 97% на наборе из 40 с лишним сложных навыков.

Модель берут для программирования и полной сдачи проектов, для работы в терминале и офисных задач. По замерам MiniMax, она набирает 56,22% в SWE-Pro, 76,5% в SWE-bench Multilingual, 57,0% в Terminal Bench 2 и 55,6% в VIBE-Pro. Компания заявляет, что в SWE-Pro модель почти дотягивает до лучшего результата Claude Opus. Она умеет несколько раз подряд точно править файлы Word, Excel и PowerPoint. В примере лаборатории модель читает финансовые отчёты TSMC и сама строит модель выручки.

Веса открыты, но лицензия ограничивает их применение. Бесплатно их можно использовать в личных, исследовательских и некоммерческих проектах. Для коммерческого применения нужно письменное разрешение MiniMax. Запрещено и применение в военных целях или для дезинформации. Чтобы запустить модель у себя в полной точности, нужно много вычислительных мощностей. Есть и версия FP8 — упрощённый формат чисел, который экономит память.

Источники: Анонс MiniMax M2.7, Карточка модели на Hugging Face, Лицензия весов

Того же уровня по индексу Epoch

Другие модели семейства

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).