Модель · Xiaomi
MiMo-V2.5
Недорогая открытая модель Xiaomi для агентов и программирования, понимает картинки, видео и звук — младшая в линейке V2.5
вышла 22 апреля
Характеристики
- Вышла
- 22 апреля
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 1 млн токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 131 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,14 за миллион токенов
- Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
- $0,003 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0,28 за миллион токенов
- Понимает
- текст, изображения, аудио, видео
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- открытые
- Знания до
- декабрь 2024
- Идентификатор в API
- mimo-v2.5
Что это за модель
MiMo-V2.5 — открытая модель Xiaomi, которая принимает на вход текст, картинки, видео и звук. Она построена по схеме смеси экспертов (mixture of experts): всего в ней 310 млрд параметров, но на каждый токен работают только 15 млрд. Поэтому модель большая, а обходится дёшево. К языковой части подключены два собственных кодировщика Xiaomi, для изображений и для звука. Её обучали на примерно 48 трлн токенов в пять этапов. На последнем этапе модель доучивали с подкреплением и перенимали навыки сразу у нескольких моделей-учителей.
Языковую основу модель взяла у MiMo-V2-Flash. Это гибридное внимание: на пять слоёв, которые смотрят только на ближний фрагмент текста, приходится один слой, который видит весь текст. Карточка модели говорит, что так память под кэш сокращается примерно в шесть раз, а это помогает держать очень длинный контекст. По сравнению с прошлыми версиями MiMo добавилось понимание звука, а контекст вырос до миллиона токенов. В линейке V2.5 это младшая модель. Старшая, MiMo-V2.5-Pro, заметно крупнее: у неё около триллиона параметров, из которых на каждый токен работают 42 млрд.
Модель берут для агентов, то есть программ, которые сами выполняют многошаговые задачи с инструментами. Её также используют для программирования и для разбора видео, графиков и документов. Лаборатория приводит такие результаты: 56,1% в SWE-Bench Pro, 65,8% в Terminal Bench 2.0 и 62,3 балла на общем наборе задач Claw-Eval. Xiaomi заявляет, что на видео модель держится на уровне Gemini 3 Pro, а в мультимодальных агентных задачах — на уровне Claude Sonnet 4.6. По словам компании, в агентных задачах модель сравнима с MiMo-V2-Pro и при этом стоит вдвое дешевле.
Веса опубликованы на Hugging Face под лицензией MIT. Она разрешает коммерческое использование, дообучение и изменение модели. Для запуска на своих серверах лаборатория официально поддерживает SGLang и vLLM. Но из-за размера в 310 млрд параметров на домашнем компьютере её не запустить. Отвечает модель только текстом: картинки, звук и видео она понимает, но не создаёт.
Источники: Анонс MiMo-V2.5 на сайте Xiaomi, Карточка модели на Hugging Face
Другие модели семейства
-
MiMo-V2.5-Pro-UltraSpeed
Xiaomiконтекст 1 млн$1,305 / $2,61открытые весарассуждениябета
-
MiMo-V2.5-Pro
Xiaomiконтекст 1 млн$0,435 / $0,87открытые весарассуждения
Новости о модели
- 01
- 02
Данные: models.dev (MIT).