Модель · Xiaomi
MiMo-V2.6-Flash-MOPD
Облегчённая открытая модель Xiaomi для агентов и программирования, дешевле Pro и реже повторяет одни и те же вызовы инструментов
вышла 27 сентября
Характеристики
- Вышла
- 27 сентября
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 1 млн токенов
- Понимает
- текст, изображения, видео, аудио
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- —
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- —
- ВесаОткрытые — файлы модели выложены в свободный доступ, и запускать и дообучать её могут не только авторы. Небольшие модели работают на обычном компьютере. Большим нужны серверы с дорогими видеокартами: такие модели разворачивают компании и облачные сервисы, а остальные пользуются ими через них. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- mimo-v2.6-flash-mopd
Что это за модель
MiMo-V2.6-Flash-MOPD — младшая модель линейки MiMo-V2.6 от Xiaomi с открытыми весами. Xiaomi подаёт Flash как более дешёвый вариант рядом со старшей Pro, при котором модель остаётся достаточно умной. Устроена она как разреженная смесь экспертов: всего у неё 309 млрд параметров, но на каждый токен работают около 15 млрд. Из 48 слоёв 39 смотрят только на ближний участок текста (так называемое скользящее окно), и лишь 9 видят весь контекст — так длинный контекст обходится дешевле. Чтобы ответ шёл быстрее, модель угадывает сразу несколько следующих токенов за один проход.
Это не новая модель, а доработка MiMo-V2.6-Flash-RL. После выхода MiMo-V2.6 выяснилось, что в роли агента — в MiMo Desktop, MiMo Code, OpenCode — модель порой раз за разом вызывала один и тот же инструмент: тратила время и контекст, но не продвигалась. Чтобы это исправить, Xiaomi применила метод MOPD — дистилляцию от нескольких учителей: модель сама решает задачи, а специально обученные модели-учителя поправляют её ответы. Под эту проблему компания обучила отдельного учителя примерно на 7 тыс. собранных случаев зацикливания. По оценке Xiaomi, дообучение обошлось примерно в 90 тыс. долларов — около 4% от цены повторного полного обучения с подкреплением.
По замерам компании, повторных вызовов стало заметно меньше при любой длине контекста и в разных обвязках — программах, через которые модель работает агентом, включая Claude Code и OpenCode. Результаты на остальных бенчмарках, по словам Xiaomi, не просели. Поэтому её берут для тех же задач, что и Flash-RL, — программирования и долгой работы с инструментами, — но она реже застревает на месте. В API Xiaomi обновлённая версия с 25 сентября работает и под обычным именем mimo-v2.6-flash.
Сама Xiaomi оговаривает, что её замер даёт лишь нижнюю границу: он учитывает только точные повторы внутри одного хода, а почти одинаковые вызовы и повторы между ходами не считает. Веса выложены под лицензией MIT: модель можно разворачивать без Xiaomi, дообучать и встраивать в свои продукты. Для запуска нужен сервер с несколькими ускорителями: в карточке модели советуют восемь для программы SGLang или от четырёх для vLLM. Остальные подключают её через API Xiaomi или OpenRouter.
Источники: Анонс в блоге Xiaomi MiMo: как убрали повторные вызовы инструментов, Карточка модели на Hugging Face
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).