модель · Inception · вышла 29 сентября
Mercury Voice
Диффузионная модель Inception для голосовых агентов: рассуждает и вызывает инструменты, успевая ответить без неловкой паузы
О модели
Mercury Voice — модель Inception для голосовых агентов. Так называют программы, которые разговаривают с людьми голосом: отвечают на звонки в поддержку или принимают заказы. Как и вся линейка Mercury, модель диффузионная. Обычная языковая модель пишет ответ по одному токену (фрагменту слова), а диффузионная уточняет сразу много мест текста параллельно, поэтому работает быстрее. Сама модель принимает и выдаёт текст: речь собеседника в текст переводит система распознавания, а ответ озвучивает синтезатор речи.
От Mercury 2.5, общей модели линейки, она отличается тем, что настроена под живой разговор. В Inception считают, что агент должен начать отвечать примерно через 500 мс после того, как собеседник замолчал, иначе пауза кажется неловкой. По замерам компании, на низком уровне рассуждений Mercury Voice в половине случаев выдаёт первый токен ответа (уже после рассуждений) быстрее чем за 320 мс, а в 95% случаев — быстрее чем за 750 мс. Компания заявляет, что из сравнённых моделей по медиане в 500 мс укладывается только она, а GPT-6 Luna без рассуждений отвечает в 5,9 раза медленнее. Уровней рассуждений три: низкий, средний и высокий. Выбирая уровень, разработчик решает, что важнее — скорость или глубина ответа.
Модель вызывает внешние инструменты и выполняет длинные системные инструкции — это нужно агентам поддержки и продаж. Inception сравнивала её на наборе тестов для агентов и диалогов. В него вошли τ³-bench (разговоры с клиентами операторов связи, магазинов и авиакомпаний), IFBench (следование инструкциям) и BFCL v4 (вызов функций). По данным компании, Mercury Voice обходит Gemma 4 31B, GPT-6 Luna, GLM-5.3-Flash и Qwen3.5-397B. По стартовой цене со скидкой минута разговора стоит около 0,9 цента — по расчёту Inception, примерно впятеро дешевле, чем с GPT-4.1.
Среди первых клиентов — Audivi AI (приём заказов в окнах для автомобилистов), финансовая компания Altur и сервис клиентской поддержки OpenCall. Модель доступна только корпоративным клиентам через API Inception. Её API совместим с форматом OpenAI, так что модель подключается к готовым платформам для голосовых агентов: LiveKit, Pipecat, Vapi и Retell. Все цифры скорости — замеры самой Inception на голосовых запросах из реальной работы.
источники:Анонс Mercury Voice в блоге Inception ↗Документация Inception: голосовые агенты ↗
Новости о модели
все упоминания · 3Inception выпустила Mercury Voice — модель для голосовых агентов
По словам стартапа Inception, новая модель Mercury Voice отвечает в разговоре с задержкой, более чем вдвое меньшей, чем у моделей вроде GPT-6 Luna.
Inception выпустила Mercury Voice — модель для голосовых агентов
Модель Inception для голосовых агентов в половине случаев начинает отвечать быстрее чем через 320 мс и стоит меньше цента за минуту разговора, по данным компании.
Данные: models.dev (MIT).