Модель · Inception
Mercury 2
Недорогая быстрая диффузионная модель Inception с рассуждениями для агентов, голоса и поиска; её сменила Mercury 2.5
вышла 24 февраля
Характеристики
- Вышла
- 24 февраля
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 128 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 50 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,25 за миллион токенов
- Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
- $0,025 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $0,75 за миллион токенов
- Понимает
- текст
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- январь 2025
- Идентификатор в API
- mercury-2
Что это за модель
Mercury 2 — языковая модель стартапа Inception, устроенная не так, как большинство чат-ботов. Обычные модели пишут ответ по одному токену слева направо. Mercury 2 — диффузионная: она сразу набрасывает целый черновик и за несколько шагов уточняет много токенов одновременно. Тот же подход лежит в основе генераторов картинок и видео. Компания называет её первой диффузионной моделью с рассуждениями и самой быстрой моделью с рассуждениями вообще.
Главное, чем Mercury 2 отличается от соседей, — скорость. По замерам Inception, на видеокартах NVIDIA Blackwell она выдаёт около 1009 токенов в секунду. Полный ответ с рассуждениями приходит примерно за 1,7 секунды, а у Gemini 3 Flash — за 14,4 и у Claude Haiku 4.5 — за 23,4. По качеству компания ставит её в один ряд с быстрыми моделями вроде GPT-5 Mini, Claude Haiku 4.5 и Gemini 3 Flash, а не с флагманами. Среди приведённых результатов — 91 на AIME, 74 на GPQA Diamond и 67 на LiveCodeBench. Глубину рассуждений можно настраивать.
Модель рассчитана на задачи, где важна задержка. Это автодополнение и правка кода в среде разработки, агентные цепочки из многих последовательных вызовов, голосовые ассистенты, которым нужно отвечать в темпе живой речи, и многошаговый поиск с генерацией по найденному. Она умеет вызывать инструменты и отдавать ответ в формате JSON по заданной схеме. API совместим с OpenAI, поэтому её можно подключить к готовому приложению без переделок.
Сама Inception позиционирует Mercury 2 как модель скоростного класса: на самых сложных задачах она уступает передовым моделям крупных лабораторий. Веса закрыты, доступ есть только через API компании и её чат. В сентябре 2026 года лаборатория выпустила следующую версию — Mercury 2.5.
Источники: Анонс Mercury 2 в блоге Inception, Пересказ анонса с бенчмарками (The Decoder)
Другие модели семейства
-
Mercury 2.5
Inceptionконтекст 260 тыс.$0,04 / $0,15рассуждения
-
Mercury Edit 2
Inceptionконтекст 32 тыс.$0,25 / $0,75
Данные: models.dev (MIT).