Inception выпустила Mercury Voice — модель для голосовых агентов
Модель Inception для голосовых агентов в половине случаев начинает отвечать быстрее чем через 320 мс и стоит меньше цента за минуту разговора, по данным компании.

Inception1 выпустила Mercury Voice — модель для голосовых агентов, которые разговаривают с клиентами по телефону. Компания утверждает, что модель обгоняет GPT-6 Luna и Gemma 4 31B и по скорости, и в тестах.
Почему это важно: голосовой агент должен начать отвечать примерно через 500 мс после того, как человек замолчал, иначе разговор не кажется естественным. По словам Inception, из моделей, которые она сравнивала, только у Mercury Voice на низком уровне рассуждений хотя бы половина ответов начинается раньше этого срока.
Как это работает: Mercury Voice, как и другие модели Mercury, — диффузионная языковая модель2. По ходу разговора она умеет обращаться к внешним программам — например, к базе заказов. Ещё она следует длинным инструкциям и рассуждает на одном из трёх уровней: низком, среднем или высоком; контекстное окно3 — 128 тыс. токенов.
Детали: все замеры провела сама Inception. Скорость она считает по времени до первых слов, которые слышит собеседник, — к этому моменту модель уже закончила рассуждать:
- На рабочих голосовых запросах половина ответов начинается быстрее чем через 320 мс, а 95% — быстрее чем через 750 мс.
- По этому показателю Mercury Voice в 5,9 раза быстрее GPT-6 Luna с выключенными рассуждениями.
- По сумме тестов τ³-bench4, IFBench и BFCL v4 на обслуживание клиентов, следование инструкциям и вызов инструментов она обходит GPT-6 Luna, Gemma 4 31B, GLM-5.3-Flash и Qwen3.5-397B.
- В посте в соцсети X компания добавила к сравнению Claude Haiku 4.5: задержка у Mercury Voice как минимум вдвое ниже, а балл в τ³-bench выше.
В цифрах: цены Mercury Voice:
- Обычная цена — 0,40 доллара за миллион входных токенов и 1,50 доллара за миллион выходных.
- На старте действует скидка 50%: 0,20 и 0,75 доллара соответственно.
- Минута разговора с типичным голосовым агентом обойдётся примерно в 0,009 доллара — по расчёту компании, это впятеро дешевле, чем с GPT-4.1 (0,045 доллара).
Расклад: API Inception совместим с API OpenAI, поэтому модель подключают к платформам для голосовых агентов вроде LiveKit, Pipecat, Vapi и Retell. По словам компании, её уже используют:
- Audivi AI: её агент без участия человека принимает заказы у водителей в окне выдачи ресторанов, вносит в них правки и предлагает добавки.
- Altur: её агенты звонят клиентам финансовых компаний и договариваются о графике платежей; во внутренних тестах Altur модель оказалась самой быстрой.
- OpenCall: её агенты отвечают на звонки клиентов, и на этих звонках половина ответов модели приходит примерно за 170 мс или быстрее.
Но: модель доступна только корпоративным клиентам и только по заявке. Скорость Inception сравнивает с GPT-6 Luna, а стоимость минуты — с GPT-4.1, моделью OpenAI 2025 года.
Inception показала предварительную версию Mercury Voice в сентябре, одновременно с универсальной моделью Mercury 2.5.