ИИтак

← Назад

Модель · Xiaomi

MiMo-V2.5-Pro-UltraSpeed

Скоростная версия флагманской MiMo-V2.5-Pro для программирования и агентов: выдаёт до 1000 токенов в секунду

вышла 8 июня

Характеристики

Вышла
8 июня
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1 млн токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 131 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1,305 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,011 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$2,61 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Знания до
декабрь 2024
Идентификатор в API
mimo-v2.5-pro-ultraspeed
Статус
бета

Что это за модель

MiMo-V2.5-Pro-UltraSpeed — это не новая модель, а ускоренный режим работы флагманской MiMo-V2.5-Pro. В ней около триллиона параметров, устроена она как смесь экспертов (mixture of experts): на каждый токен работает только часть сети. Xiaomi сделала этот режим вместе с командой TileRT. По данным компании, модель впервые для такого размера выдаёт больше 1000 токенов в секунду, и для этого хватает одного обычного сервера с восемью видеокартами, без специальных чипов.

Скорость дают три приёма. Первый — квантизация: веса экспертов хранятся в сжатом четырёхбитном формате FP4, а остальная часть сети — в полной точности. Второй — спекулятивное декодирование DFlash: маленькая черновая модель предлагает сразу блок следующих токенов, а большая их проверяет. Третий — системные оптимизации TileRT, при которых вычисления и передача данных идут одновременно. Компания заявляет, что по качеству ответов ускоренная версия практически не отстаёт от обычной Pro. При этом генерация идёт примерно в десять раз быстрее, а API стоит втрое дороже.

Такой режим выбирают там, где важна скорость: для агентов, которые делают длинные цепочки шагов, для программирования и сценариев в реальном времени. Сжатые веса и параметры черновой модели DFlash Xiaomi выложила на Hugging Face.

Сама лаборатория оговаривает, что в обычных разговорах ускорение слабее. Черновая модель там реже угадывает следующие токены, и Xiaomi продолжает её дорабатывать. На старте доступ был ограничен: пробный период с 9 по 23 июня 2026 года, только по заявкам и только через API, без подписки Token Plan.

Источники: Анонс в блоге Xiaomi MiMo, Страница модели на платформе MiMo

Другие модели семейства

Новости о модели

  1. 01

    Независимый рейтинг поставил MiMo-V2.6-Pro от Xiaomi первой среди открытых моделей

    Клеман Деланг

  2. 02

    Xiaomi выпустила MiMo-V2.6-Pro-RL — открытую модель на 1 трлн параметров для агентов

    MiMo · HF

все 2 новости о MiMo-V2.5 →

Данные: models.dev (MIT).