Google выпустила модели синтеза речи Gemini 3.8 Flash TTS и Flash-Lite TTS
Новые модели создают голос по текстовому описанию на 100 с лишним языках и копируют существующий по 30-секундной записи, но только с записанным согласием владельца.

Google DeepMind выпустила две модели синтеза речи1 — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS, говорится в блоге компании. Flash TTS рассчитана на создание персонажей и постановку сцен в играх, аудиокнигах и подкастах. Flash-Lite TTS нужна для больших объёмов по низкой цене: дубляжа, озвучки контента и голосовых агентов.
Разработчикам обе модели доступны с сегодняшнего дня в Gemini API и Google AI Studio. Корпоративным клиентам их откроют через API в Gemini Enterprise позже. Обычным пользователям Flash TTS достанется в Gemini Notebook, а Flash-Lite TTS — в видеоредакторе Google Vids. Цены компания не назвала.
Голос можно задать словами: роль, акцент, манеру речи. В примерах Google — энергичный диджей из Мельбурна, монотонный робот с жестяным звуком и японский дракон. Раньше у моделей было 30 готовых голосов, теперь в библиотеке больше 2 000, в том числе на мексиканском испанском и квебекском французском. Всего модели поддерживают больше 100 языков и диалектов.
Для клонирования голоса2 хватает 30-секундной записи. Копировать разрешено только свой голос или тот, на который есть права. Перед созданием копии нужно загрузить устное согласие владельца голоса, и система проверяет, что на обеих записях один и тот же человек. В Google AI Studio клонирование недоступно в Иллинойсе, Техасе, Европейской экономической зоне, Великобритании, Швейцарии и Индии.
Всё аудио голосовых моделей Gemini помечается незаметным водяным знаком SynthID3. Копии голосов дополнительно получают метаданные о происхождении контента4 по стандарту C2PA.
Каждую реплику можно режиссировать: прописать ремарки о темпе и эмоциях или вставить в сценарий теги смеха, вздоха и поддакивания вроде «угу». Модели разыгрывают сцену на два голоса по одному сценарию и, по словам Google, сохраняют тембр персонажа на протяжении часов непрерывной записи. Настройку готового голоса запросом вроде «добавь лёгкий южный акцент» обещают позже.
Flash TTS заняла первое место в Voice Design Benchmark — тесте Hume AI на создание голосов — с 71,4 балла. В общем индексе качества Hume AI модели заняли первое и второе места. На платформе Voice Arena, где слушатели вслепую выбирают лучшую запись, обе модели вошли в число лидеров по японскому, хинди, вьетнамскому и ещё нескольким языкам, сообщает Google.
Hume AI — нью-йоркский стартап, который разрабатывает голосовые модели и инструменты для распознавания эмоций по голосу. В январе 2026 года его основатель Алан Коуэн перешёл в Google DeepMind по лицензионной сделке, а сама компания осталась независимой. Нынешний анонс Коуэн подписал как директор по исследованиям команды Gemini Audio.
Ранее, 15 сентября, Google выпустила голосовые модели Gemini 3.8 Live и 3.8 Live Extended Thinking для разговора в реальном времени. По данным компании, Flash TTS и Flash-Lite TTS заметно лучше, чем Gemini 3.1 Flash TTS, справляются с длинными текстами и диалогами двух персонажей.