ИИтак

← Назад

Модель · Inception

Mercury 2

Недорогая быстрая диффузионная модель Inception с рассуждениями для агентов, голоса и поиска; её сменила Mercury 2.5

вышла 24 февраля

Характеристики

Вышла
24 февраля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
128 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 50 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,25 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,025 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$0,75 за миллион токенов
Понимает
текст
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
январь 2025
Идентификатор в API
mercury-2

Что это за модель

Mercury 2 — языковая модель стартапа Inception, устроенная не так, как большинство чат-ботов. Обычные модели пишут ответ по одному токену слева направо. Mercury 2 — диффузионная: она сразу набрасывает целый черновик и за несколько шагов уточняет много токенов одновременно. Тот же подход лежит в основе генераторов картинок и видео. Компания называет её первой диффузионной моделью с рассуждениями и самой быстрой моделью с рассуждениями вообще.

Главное, чем Mercury 2 отличается от соседей, — скорость. По замерам Inception, на видеокартах NVIDIA Blackwell она выдаёт около 1009 токенов в секунду. Полный ответ с рассуждениями приходит примерно за 1,7 секунды, а у Gemini 3 Flash — за 14,4 и у Claude Haiku 4.5 — за 23,4. По качеству компания ставит её в один ряд с быстрыми моделями вроде GPT-5 Mini, Claude Haiku 4.5 и Gemini 3 Flash, а не с флагманами. Среди приведённых результатов — 91 на AIME, 74 на GPQA Diamond и 67 на LiveCodeBench. Глубину рассуждений можно настраивать.

Модель рассчитана на задачи, где важна задержка. Это автодополнение и правка кода в среде разработки, агентные цепочки из многих последовательных вызовов, голосовые ассистенты, которым нужно отвечать в темпе живой речи, и многошаговый поиск с генерацией по найденному. Она умеет вызывать инструменты и отдавать ответ в формате JSON по заданной схеме. API совместим с OpenAI, поэтому её можно подключить к готовому приложению без переделок.

Сама Inception позиционирует Mercury 2 как модель скоростного класса: на самых сложных задачах она уступает передовым моделям крупных лабораторий. Веса закрыты, доступ есть только через API компании и её чат. В сентябре 2026 года лаборатория выпустила следующую версию — Mercury 2.5.

Источники: Анонс Mercury 2 в блоге Inception, Пересказ анонса с бенчмарками (The Decoder)

Другие модели семейства

Данные: models.dev (MIT).