ИИтак

← Назад

Модель · Xiaomi

MiMo-V2.6-Pro-RL

Флагманская открытая модель Xiaomi для агентов и программирования, по замерам лаборатории близкая к Claude Opus

вышла 21 сентября

Характеристики

Вышла
21 сентября
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1 млн токенов
Понимает
текст, изображения, видео, аудио
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
mimo-v2.6-pro-rl

Что это за модель

MiMo-V2.6-Pro-RL — старшая модель линейки MiMo-V2.6 от Xiaomi. Она построена как смесь экспертов: в сети 1,02 трлн параметров, но на каждый токен включаются только 42 млрд из них. Поэтому модель работает быстрее и дешевле, чем плотная сеть того же размера. Чтобы держать длинный контекст, большинство слоёв смотрят только на ближайший отрезок текста (скользящее окно), и лишь часть слоёв видит его целиком. К языковой части добавлены отдельные кодировщики для картинок и звука, а небольшой дополнительный блок угадывает сразу несколько следующих токенов и ускоряет ответ.

Главное отличие от MiMo-V2.5-Pro — в дообучении. Xiaomi провела один общий запуск обучения с подкреплением (метод, при котором модель пробует решить задачу и получает оценку за результат) сразу по программированию, агентным задачам, работе с изображениями и кибербезопасности. На каждом шаге модель решала 1568 задач по 16 попыток на каждую. Ход обучения лаборатория показывала публично, на открытой странице с графиками. Рядом с ней вышла облегчённая MiMo-V2.6-Flash-RL, она меньше и дешевле в работе.

Модель берут для агентов: долгих задач, в которых нужно самой писать и править код, вызывать инструменты и управлять компьютером. По замерам лаборатории, она набирает 71,9% в DeepSWE v1.1 (Claude Opus — 74,0%, GPT-5.6 — 73,0%), 82,0% в OSWorld-Verified на управление компьютером и 76,9% в Toolathlon-Verified на работу с инструментами. В тесте по кибербезопасности CyberGym Xiaomi заявляет 94,0% и заметный отрыв от соперников.

Даже по собственным замерам Xiaomi модель в большинстве агентных тестов немного уступает Claude Opus. Веса выложены под лицензией MIT, её можно использовать и в коммерческих целях. Но при триллионе параметров запустить модель у себя можно только на серверном оборудовании с большим объёмом памяти видеокарт.

Источники: Карточка модели на Hugging Face, Страница обучения MiMo-V2.6

Новости о модели

  1. 01

    Xiaomi перелила навыки MiMo-V2.6 в Qwen3.5-9B и выложила заготовку для обучения агентов

    MiMo · HF

  2. 02

    Независимый рейтинг поставил MiMo-V2.6-Pro от Xiaomi первой среди открытых моделей

    Клеман Деланг

  3. 03

    Xiaomi выложила MiMo-V2.6-Flash-RL — облегчённую открытую модель для агентов

    MiMo · HF

  4. 04

    Xiaomi выпустила MiMo-V2.6-Pro-RL — открытую модель на 1 трлн параметров для агентов

    MiMo · HF

все 4 новости о MiMo-V2.6 →

Данные: models.dev (MIT).