Модель · Xiaomi
MiMo-V2.6-Pro-MOPD
Флагманская открытая модель Xiaomi для агентов и программирования, дообученная реже зацикливаться на вызовах инструментов
вышла 27 сентября
Характеристики
- Вышла
- 27 сентября
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 1 млн токенов
- Понимает
- текст, изображения, видео, аудио
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- —
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- —
- ВесаОткрытые — файлы модели выложены в свободный доступ, и запускать и дообучать её могут не только авторы. Небольшие модели работают на обычном компьютере. Большим нужны серверы с дорогими видеокартами: такие модели разворачивают компании и облачные сервисы, а остальные пользуются ими через них. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- mimo-v2.6-pro-mopd
Что это за модель
MiMo-V2.6-Pro-MOPD — исправленная версия MiMo-V2.6-Pro-RL, старшей модели линейки MiMo-V2.6. Устроена она как смесь экспертов (mixture of experts): внутри много специализированных блоков, и на каждый токен работает только часть из них. Всего у модели 1,02 трлн параметров, активны из них 42 млрд: из 384 экспертов на токен включаются восемь. Картинки, видео и звук она принимает через отдельные кодировщики. Ещё у неё есть модуль, который угадывает несколько следующих токенов сразу, чтобы ускорить ответ.
После выхода MiMo-V2.6 самой заметной проблемой в агентной работе оказались повторы. Модель раз за разом вызывала одни и те же инструменты (поиск, запуск кода, работу с файлами). Со стороны казалось, что она занята, но дело не двигалось, а время и контекст уходили. По разбору Xiaomi, причина была в обучении с подкреплением: штраф за лавину вызовов срабатывал только после 32 вызовов за ход, и привычка к повторам постепенно усиливалась. Переучивать модель заново стоило бы, по оценке компании, около 2,31 млн долларов. Вместо этого Xiaomi обучила узкую модель-«учителя» примерно на 7 тыс. примеров и перенесла её навык в основную модель. Этот метод компания называет MOPD2: несколько учителей поправляют ученика прямо на его собственных ответах. Исправление обошлось примерно в 90 тыс. долларов. По замерам компании, в агентной обвязке OpenCode (программе, через которую модель работает с кодом) доля повторов упала с 0,54% почти до нуля, а результаты на остальных бенчмарках не просели.
Xiaomi называет Pro самой сильной своей моделью. Её предлагают для сложных проектов и долгих задач: программирования, офисной работы, исследований, кибербезопасности, управления компьютером. По подсчёту Artificial Analysis, базовая MiMo-V2.6-Pro набрала 46,32 балла в сводном индексе. Компания называет это лучшим результатом среди открытых моделей. В API Xiaomi исправление против повторов с 25 сентября получила и обычная mimo-v2.6-pro.
Веса выложены по лицензии MIT: модель можно разворачивать без Xiaomi, дообучать и встраивать в свои продукты. Для запуска документация советует сервер на 16 видеокарт с движком SGLang или хотя бы восемь с vLLM, поэтому у себя её ставят компании, а остальные берут через сервисы. У замера повторов Xiaomi сама называет ограничения. Он ловит только точные повторы внутри одного ответа. Повторы после того, как инструмент уже ответил, почти одинаковые вызовы с чуть другими параметрами и вызовы внутри запускаемых скриптов в него не попадают.
Источники: Карточка модели на Hugging Face, Блог Xiaomi: как исправляли повторные вызовы инструментов, Страница MiMo-V2.6-Pro у Xiaomi
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).