Модель · Xiaomi
MiMo-V2.6-Distill-Qwen-9B
Малая открытая модель Xiaomi на основе Qwen3.5-9B для программирования и агентов, заготовка для исследований
вышла 21 сентября
Характеристики
- Вышла
- 21 сентября
- Понимает
- текст, изображения
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- mimo-v2.6-distill-qwen-9b
Что это за модель
MiMo-V2.6-Distill-Qwen-9B — это не собственная разработка Xiaomi с нуля, а чужая открытая модель Qwen3.5-9B от Alibaba. В ней 9 млрд параметров, и Xiaomi дообучила её на данных, которые сгенерировали её большие модели MiMo-V2.6. Такой приём называют дистилляцией: навыки крупной модели переносят в маленькую. На дообучение ушло 77,4 млрд токенов из четырёх областей: программирование (около 30%), общие задачи (28,5%), работа с изображениями и вёрстка по картинке (27,4%) и кибербезопасность (14,2%). Упор сделан на агентное поведение, то есть на умение самой работать с инструментами и доводить многошаговые задачи до конца.
От соседок по линейке она отличается прежде всего размером. MiMo-V2.6-Pro-RL и MiMo-V2.6-Flash-RL — большие модели со смесью экспертов (mixture of experts) на сотни миллиардов параметров, им нужны серверы. Модель на 9 млрд параметров можно запустить на куда более скромном железе. По замерам Xiaomi, дообучение заметно подтянуло исходную Qwen3.5-9B: в SWE-bench Pro, где модель исправляет ошибки в реальных репозиториях, результат вырос с 32 до 44,6 балла, в AutomationBench — с 5 до 30,3. В SWE-bench Verified прирост почти незаметен: 61,1 против 60.
Xiaomi прямо называет модель отправной точкой для открытых исследований обучения агентов с подкреплением. Иначе говоря, это заготовка для тех, кто хочет дальше учить агента на своих задачах, а не готовый продукт для чата. Лаборатория советует включать режим рассуждений: модель сначала думает, потом отвечает.
Часть тестов, на которые ссылается Xiaomi, внутренние: например, её собственные наборы по кибербезопасности и визуальному программированию. Сравнить эти цифры с чужими моделями нельзя. На офисных задачах результаты пока скромные: 19,5 балла в OfficeQA и 18,3 в JobBench.
Источники: Карточка модели на Hugging Face
Новости о модели
- 01
- 02
- 03
- 04
Данные: models.dev (MIT).