ИИтак

← Назад

Модель · Xiaomi

MiMo-V2.5

Недорогая открытая модель Xiaomi для агентов и программирования, понимает картинки, видео и звук — младшая в линейке V2.5

вышла 22 апреля

Характеристики

Вышла
22 апреля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1 млн токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 131 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,14 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,003 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,28 за миллион токенов
Понимает
текст, изображения, аудио, видео
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
декабрь 2024
Идентификатор в API
mimo-v2.5

Что это за модель

MiMo-V2.5 — открытая модель Xiaomi, которая принимает на вход текст, картинки, видео и звук. Она построена по схеме смеси экспертов (mixture of experts): всего в ней 310 млрд параметров, но на каждый токен работают только 15 млрд. Поэтому модель большая, а обходится дёшево. К языковой части подключены два собственных кодировщика Xiaomi, для изображений и для звука. Её обучали на примерно 48 трлн токенов в пять этапов. На последнем этапе модель доучивали с подкреплением и перенимали навыки сразу у нескольких моделей-учителей.

Языковую основу модель взяла у MiMo-V2-Flash. Это гибридное внимание: на пять слоёв, которые смотрят только на ближний фрагмент текста, приходится один слой, который видит весь текст. Карточка модели говорит, что так память под кэш сокращается примерно в шесть раз, а это помогает держать очень длинный контекст. По сравнению с прошлыми версиями MiMo добавилось понимание звука, а контекст вырос до миллиона токенов. В линейке V2.5 это младшая модель. Старшая, MiMo-V2.5-Pro, заметно крупнее: у неё около триллиона параметров, из которых на каждый токен работают 42 млрд.

Модель берут для агентов, то есть программ, которые сами выполняют многошаговые задачи с инструментами. Её также используют для программирования и для разбора видео, графиков и документов. Лаборатория приводит такие результаты: 56,1% в SWE-Bench Pro, 65,8% в Terminal Bench 2.0 и 62,3 балла на общем наборе задач Claw-Eval. Xiaomi заявляет, что на видео модель держится на уровне Gemini 3 Pro, а в мультимодальных агентных задачах — на уровне Claude Sonnet 4.6. По словам компании, в агентных задачах модель сравнима с MiMo-V2-Pro и при этом стоит вдвое дешевле.

Веса опубликованы на Hugging Face под лицензией MIT. Она разрешает коммерческое использование, дообучение и изменение модели. Для запуска на своих серверах лаборатория официально поддерживает SGLang и vLLM. Но из-за размера в 310 млрд параметров на домашнем компьютере её не запустить. Отвечает модель только текстом: картинки, звук и видео она понимает, но не создаёт.

Источники: Анонс MiMo-V2.5 на сайте Xiaomi, Карточка модели на Hugging Face

Другие модели семейства

Новости о модели

  1. 01

    Независимый рейтинг поставил MiMo-V2.6-Pro от Xiaomi первой среди открытых моделей

    Клеман Деланг

  2. 02

    Xiaomi выпустила MiMo-V2.6-Pro-RL — открытую модель на 1 трлн параметров для агентов

    MiMo · HF

все 2 новости о MiMo-V2.5 →

Данные: models.dev (MIT).