Google добавила в голосовую Gemini 3.8 Live говорящий видеоаватар
Аватар двигает губами в такт речи на 97 языках и обращается к внешним сервисам, не прерывая разговор. Своего персонажа по фотографии пока создают только компании из списка допущенных.

Голосовая модель Gemini 3.8 Live научилась отвечать не только голосом, но и видео. Функция Live Avatar показывает на экране анимированного собеседника, и видео с ним генерируется почти в реальном времени, говорится в блоге Google DeepMind. Функция вышла 24 сентября в Gemini Enterprise — платформе Google Cloud, на которой компании создают своих ИИ-агентов.
Движения губ аватара совпадают с речью, он меняет выражение лица и вовремя уступает слово собеседнику. Звук и изображение модель принимает одновременно и отвечает на то, что видит и слышит. Google предлагает ставить таких аватаров в службы поддержки клиентов и в интерактивные инструкции.
Во время разговора аватар может в фоне обращаться к внешним сервисам и загружать данные. В Google это называют асинхронным вызовом инструментов. В демонстрации компании аватар так заселяет гостя в отель: запросы к системам идут параллельно, а диалог не прерывается.
Аватар говорит на 97 языках и может сменить язык посреди разговора. Мимика и движения губ при этом подстраиваются под новый язык, а качество видео, по словам разработчиков, не падает.
Кроме библиотеки готовых персонажей, компании могут сделать своего аватара по одному качественному снимку. Модель сохраняет сходство с оригиналом и фирменный стиль. Создавать собственных аватаров пока могут только компании, которых Google внесла в список допущенных.
Всё аудио и видео, которое выдаёт Live Avatar, помечено незаметным водяным знаком SynthID1, чтобы сгенерированный ролик можно было распознать. Цену функции Google не назвала.
Ранее, 15 сентября, Google выпустила голосовые модели Gemini 3.8 Live и 3.8 Live Extended Thinking для разработчиков: минута входящего звука стоит $0,005, исходящего — $0,018. В тот же день Gemini 3.8 Live появилась в поиске, а 3.8 Live Extended Thinking — в Gmail и Docs. 23 сентября компания представила модели синтеза речи Gemini 3.8 Flash TTS и Flash-Lite TTS.