Xiaomi раскрыла рецепт MiMo-V2.6-Pro: обучение с подкреплением оценили в 2,6 млн долларов
По сторонней оценке, обучение с подкреплением у MiMo-V2.6-Pro, лучшей открытой модели в рейтинге Artificial Analysis, стоило около 2,6 млн долларов. Xiaomi открывает рецепты обучения и код, который выдаёт модели задачи и проверяет ответы.
Xiaomi официально выпустила MiMo-V2.6-Pro и выложила вместе с весами подробный отчёт о том, как её обучали с подкреплением. На этом этапе модель раз за разом решает задачи: чинит код, воспроизводит уязвимости, верстает сайты — и учится на оценках своих попыток. Финальный прогон, по подсчётам, которые приводит рассылка Latent Space, занял 130 часов и 75 млрд токенов и обошёлся примерно в 2,6 млн долларов. Это цена только финального этапа, а не обучения модели с нуля.
Xiaomi известна прежде всего смартфонами, и к шестёрке китайских «ИИ-тигров» её не относили. Теперь её модель возглавила рейтинг открытых моделей Artificial Analysis с 46 баллами. В MiMo-V2.6-Pro 1,02 трлн параметров, из которых на каждый токен работают 42 млрд. Она понимает текст, картинки, видео и звук и распространяется под лицензией MIT.
Через API миллион входных токенов стоит 0,435 доллара, выходных — 0,87. Для тех, кому важна скорость, есть MiMo-V2.6-Pro-UltraSpeed: по словам Xiaomi, она выдаёт ответ до 20 раз быстрее при том же качестве. Вместе с Pro вышла облегчённая MiMo-V2.6-Flash.
Вычислительные мощности для обучения с подкреплением Xiaomi наращивала сразу в трёх направлениях: объём данных на каждом шаге, число разных задач и ресурсы на проверку попыток. На одно обновление весов шло 1 568 примеров, за шаг модель проходила до 3,7 млрд токенов, а контекст доходил до 1 млн токенов. Программирование, работу агентов, визуальные задания и кибербезопасность учили в одном прогоне, чтобы рост в одном навыке подтягивал остальные. Больше вычислений потратили и на оценку: модель решает одну и ту же задачу несколько раз, и эти попытки сравнивают между собой. Так она получает более точный сигнал в долгих задачах и приучается решать их короче, тратя меньше токенов.
Необычна и открытость самого процесса. Несколько дней назад Ло Фули, которая раньше была одной из заметных инженеров DeepSeek, а теперь работает в Xiaomi, начала выкладывать финальные прогоны прямо по ходу обучения — с внутренними метриками, которые лаборатории обычно держат при себе. Модель и отчёт вышли меньше чем через неделю после окончания последнего прогона.
Код учебных сред и рецепты обучения уже выложены: для программирования, воспроизведения уязвимостей, интеллектуального труда, веб-разработки и даже генерации музыки, плюс готовые настройки агентов. Полный набор из более чем 7 000 задач пока не опубликован. Тома Вольф из Hugging Face и другие комментаторы считают, что хорошие открытые среды для обучения с подкреплением теперь значат не меньше, чем на прошлом этапе развития ИИ значили огромные массивы текстов, на которых модели проходят основное обучение. Latent Space делает вывод: если цифры подтвердятся, дообучение окажется куда более дешёвой дорогой к уровню передовых моделей, чем многие думали.