ИИтак

← Назад

Модель · Inception

Mercury 2.5

Бюджетная диффузионная модель Inception с рассуждением: быстро отвечает в поиске, голосовых помощниках и агентах

вышла 8 сентября

Характеристики

Вышла
8 сентября
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
260 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 65 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,04 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,004 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,15 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
ноябрь 2025
Идентификатор в API
mercury-2.5

Что это за модель

Mercury 2.5 — языковая модель на диффузии (dLLM). Обычные модели пишут ответ по одному токену слева направо. Диффузионная сначала набрасывает черновик всего ответа, а потом за несколько проходов уточняет его части одновременно. Отсюда её главное свойство — скорость: по замерам Inception, модель выдаёт 1107 токенов в секунду на обычных видеокартах NVIDIA. Компания называет её самой большой диффузионной языковой моделью из обученных на сегодня, но размер не называет.

Это следующая версия после Mercury 2. По внутренним замерам Inception, модель стала умнее примерно на 40%, а скорость осталась прежней. Контекстное окно выросло со 128 до 260 тысяч токенов, так что в один запрос помещается примерно вдвое больше кода или документов. Добавились настраиваемая глубина рассуждения, параллельные вызовы инструментов и ответы в формате JSON строго по заданной схеме. По качеству ответов компания ставит её в один ряд не с флагманами, а с недорогими моделями конкурентов: GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite и Claude Haiku 4.5.

Её выбирают там, где на одно действие пользователя приходится много обращений к модели и задержки складываются. Первый пример — поиск и генерация с поиском, то есть ответы с опорой на найденные документы. Там модель разбирает запрос, переписывает его, переранжирует и сжимает результаты. Второй — голосовые помощники: по словам Inception, у сервиса OpenCall после перехода на Mercury задержка в худших случаях упала с нескольких минут до секунды. Третий — вспомогательные задачи в программировании: в Augment Code сжатие контекста ускорилось примерно со 150 до 27 секунд.

Модель работает только с текстом и делает ставку на скорость и цену, а не на предельное качество. На сложных задачах её разумнее сравнивать с облегчёнными версиями чужих моделей, а не с флагманами. Веса закрыты: модель доступна через API Inception, а также через OpenRouter и Baseten, корпоративным клиентам компания предлагает выделенные мощности. Цена в таблице — стартовая, со скидкой 80%. Обычный тариф в пять раз выше: $0,20 за миллион токенов входа и $0,75 за миллион выхода.

Источники: Анонс Mercury 2.5 в блоге Inception

Другие модели семейства

Данные: models.dev (MIT).