Google выпустила голосовые модели Gemini 3.8 Live: агент работает, не прерывая разговор
Разработчикам стали доступны голосовые модели Gemini 3.8 Live и 3.8 Live Extended Thinking. Они ведут разговор и параллельно выполняют задачи. Минута входящего звука стоит примерно полцента, минута ответа — около 1,8 цента.

Google выпустила для разработчиков две голосовые модели — Gemini 3.8 Live и 3.8 Live Extended Thinking. На них можно строить голосовых агентов, которые выполняют поручения и при этом продолжают говорить с пользователем. Модели доступны через Gemini Live API и в Google AI Studio.
Главная новинка — асинхронный вызов функций. Агент обращается к внешним сервисам и инструментам в фоне и не замолкает, пока ждёт ответа. Кроме того, модели учитывают то, что пользователь показывает на камеру, точнее разбирают коды подтверждения и номера заявок и работают с 97 с лишним языками. Звук и текст обрабатывает одна модель, а не цепочка из распознавания, текстовой модели и синтеза речи. Google называет такую схему более простой альтернативой каскадной архитектуре.
Версия Extended Thinking рассчитана на сложные запросы. Она может рассуждать в несколько шагов в фоне, а тем временем отвечать собеседнику или рассказывать, как продвигается работа. Глубину рассуждений можно настраивать. По словам Google, эта модель занимает первое место в рейтинге Artificial Analysis среди моделей, которые принимают речь и отвечают речью.
Минута входящего звука стоит 0,005 доллара, минута ответа — 0,018 доллара. Это оценка компании, пересчитанная из цены за токены: 3 и 12 долларов за миллион. Модели также можно подключить через Agora, LiveKit, LangChain, Pipecat, Vercel и других партнёров, которые берут на себя передачу аудио- и видеопотока.
В том же сообщении Google напомнила о модели распознавания речи Gemini 3.5 Transcribe, вышедшей в прошлом месяце. Средний WER у неё 4% при потоковой расшифровке и 2,6% при обработке готовой записи. Теперь модели можно передать список до 1 000 специальных терминов и названий, которые она должна распознавать точнее. Через Interactions API она расшифровывает записи длиной до часа, ставит временные метки и отмечает, кто из собеседников говорит.