Xiaomi перелила навыки MiMo-V2.6 в Qwen3.5-9B и выложила заготовку для обучения агентов
Xiaomi выложила MiMo-V2.6-Distill-Qwen-9B — модель Qwen3.5-9B, дообученную на данных от MiMo. Её предлагают как отправную точку для исследований обучения агентов с подкреплением. По заявленным тестам она заметно обходит исходную Qwen.
Xiaomi взяла открытую модель Qwen3.5-9B от Alibaba и дообучила её на ответах собственных моделей MiMo. Получилась MiMo-V2.6-Distill-Qwen-9B — модель на 9 млрд параметров для программирования, задач агентов, вёрстки по картинкам и кибербезопасности. Она принимает на вход текст и изображения и умеет рассуждать перед ответом.
Это не готовый продукт, а промежуточная точка. Модель прошла только обучение на примерах, без этапа с подкреплением, когда модель учат на собственных попытках и оценках за них. Этот этап Xiaomi оставляет исследователям: чекпойнт выложен как отправная точка для открытых работ по обучению агентов с подкреплением. В тот же день компания выпустила флагман MiMo-V2.6-Pro-RL и облегчённую MiMo-V2.6-Flash-RL, которые такой этап прошли.
На обучение ушло 77,4 млрд токенов. Примерно по трети пришлось на код, общие задачи агентов и визуальные задачи, ещё 14% — на кибербезопасность. Модель учили не на всём этом объёме: ошибку считали только на 27,2 млрд токенов, то есть в основном на ответах, а не на условиях задач.
По цифрам из технического отчёта MiMo-V2.6 прирост над исходной Qwen неравномерный. На SWE Verified, где модель чинит реальные ошибки в коде, почти ничего не изменилось: 61,1 против 60. На более сложном SWE Pro результат вырос с 32 до 44,6, в Terminal Bench 2.1 — с 27 до 37,1. Самые большие скачки — на внутренних тестах Xiaomi: в задачах по кибербезопасности с 5,7 до 31,3. Их составляла сама компания, так что сравнить с чужими моделями не получится.
Для запуска авторы советуют свежую сборку серверного движка SGLang с поддержкой Qwen3.5. Лицензию на странице модели Xiaomi не указала.