Новая MiMo-V2.6-Flash от Xiaomi реже вызывает инструменты по кругу
Xiaomi выложила открытую MiMo-V2.6-Flash-MOPD. По данным компании, в роли агента она реже повторяет одни и те же действия, а исправление обошлось примерно в 90 тыс. долларов.

Xiaomi выложила на Hugging Face MiMo-V2.6-Flash-MOPD — доработанную версию своей открытой модели. По данным компании, она реже застревает в агентных задачах, когда раз за разом вызывает один и тот же инструмент.
Почему это важно: такой сбой не выдаёт ошибки. Агент выглядит занятым, тратит время и место в контексте, но задача не движется, поэтому сбой легко не заметить.
Предыстория: прежнюю версию, MiMo-V2.6-Flash-RL, Xiaomi выложила 21 сентября вместе со старшей моделью на триллион параметров. Компания признаёт, что вскоре после выхода MiMo-V2.6 повторы вызовов инструментов стали одной из самых заметных проблем модели в агентных сценариях.
Откуда сбой: в техническом блоге от 27 сентября Xiaomi объясняет, что во время обучения с подкреплением1 обрывали попытку решить задачу, только если модель делала больше 32 вызовов за один ход. Всё, что ниже порога, не наказывалось, и привычка вызывать инструменты снова и снова постепенно росла, пока не превратилась в заметные повторы.
Как это работает: новая версия — тот же чекпоинт2 Flash-RL, прошедший этап MOPD: модель решает задачи сама, а несколько узкоспециализированных моделей-учителей оценивают её шаги. Против повторов Xiaomi обучила отдельного учителя, который приучает модель вовремя заканчивать ход, и добавила его в этот этап.
В цифрах: исправление вышло дешёвым:
- Учителя против повторов обучали 12 шагов примерно на 7 000 примерах, а весь прогон обошёлся примерно в 90 тыс. долларов.
- Прямой путь — снизить порог и заново провести 20 шагов обучения с подкреплением — обошёлся бы, по оценке Xiaomi, в 2,31 млн долларов.
- Выходит, что исправление обошлось примерно в 4% от этой суммы.
Если шире: вторая версия метода, MOPD2, объединяет в одной модели знания учителей, в том числе из тех областей, где правильность ответа трудно проверить автоматически. Xiaomi называет длинные многошаговые задачи по созданию игр, научные исследования и ИИ, который действует в физическом мире.
Детали: что известно о моделях:
- MiMo-V2.6-Flash-MOPD — смесь экспертов3 на 309 млрд параметров, из которых на каждый токен работают 15 млрд.
- Модель держит контекст до 1 млн токенов и кроме текста понимает картинки, видео и звук.
- Веса открыты по лицензии MIT. Модель также доступна через API Xiaomi, OpenRouter и приложения MiMo Studio и MiMo Desktop.
- Такую же доработку получила старшая MiMo-V2.6-Pro-MOPD на 1,02 трлн параметров, из которых на токен работают 42 млрд.
Но: результатов бенчмарков для новых версий в описании модели на Hugging Face нет. Снижение доли повторов в девяти обвязках4 для агентов, включая Claude Code, Codex и OpenCode, Xiaomi показывает только на собственном графике.