ИИтак

← Назад

модель · Inception · вышла 29 сентября

Mercury Voice

Диффузионная модель Inception для голосовых агентов: рассуждает и вызывает инструменты, успевая ответить без неловкой паузы

О модели

Mercury Voice — модель Inception для голосовых агентов. Так называют программы, которые разговаривают с людьми голосом: отвечают на звонки в поддержку или принимают заказы. Как и вся линейка Mercury, модель диффузионная. Обычная языковая модель пишет ответ по одному токену (фрагменту слова), а диффузионная уточняет сразу много мест текста параллельно, поэтому работает быстрее. Сама модель принимает и выдаёт текст: речь собеседника в текст переводит система распознавания, а ответ озвучивает синтезатор речи.

От Mercury 2.5, общей модели линейки, она отличается тем, что настроена под живой разговор. В Inception считают, что агент должен начать отвечать примерно через 500 мс после того, как собеседник замолчал, иначе пауза кажется неловкой. По замерам компании, на низком уровне рассуждений Mercury Voice в половине случаев выдаёт первый токен ответа (уже после рассуждений) быстрее чем за 320 мс, а в 95% случаев — быстрее чем за 750 мс. Компания заявляет, что из сравнённых моделей по медиане в 500 мс укладывается только она, а GPT-6 Luna без рассуждений отвечает в 5,9 раза медленнее. Уровней рассуждений три: низкий, средний и высокий. Выбирая уровень, разработчик решает, что важнее — скорость или глубина ответа.

Модель вызывает внешние инструменты и выполняет длинные системные инструкции — это нужно агентам поддержки и продаж. Inception сравнивала её на наборе тестов для агентов и диалогов. В него вошли τ³-bench (разговоры с клиентами операторов связи, магазинов и авиакомпаний), IFBench (следование инструкциям) и BFCL v4 (вызов функций). По данным компании, Mercury Voice обходит Gemma 4 31B, GPT-6 Luna, GLM-5.3-Flash и Qwen3.5-397B. По стартовой цене со скидкой минута разговора стоит около 0,9 цента — по расчёту Inception, примерно впятеро дешевле, чем с GPT-4.1.

Среди первых клиентов — Audivi AI (приём заказов в окнах для автомобилистов), финансовая компания Altur и сервис клиентской поддержки OpenCall. Модель доступна только корпоративным клиентам через API Inception. Её API совместим с форматом OpenAI, так что модель подключается к готовым платформам для голосовых агентов: LiveKit, Pipecat, Vapi и Retell. Все цифры скорости — замеры самой Inception на голосовых запросах из реальной работы.

Новости о модели

все упоминания · 3
  1. Inception выпустила Mercury Voice — модель для голосовых агентов

    По словам стартапа Inception, новая модель Mercury Voice отвечает в разговоре с задержкой, более чем вдвое меньшей, чем у моделей вроде GPT-6 Luna.

  2. Inception выпустила Mercury Voice — модель для голосовых агентов

    Модель Inception для голосовых агентов в половине случаев начинает отвечать быстрее чем через 320 мс и стоит меньше цента за минуту разговора, по данным компании.

Данные: models.dev (MIT).