Модель · Google
Gemini 3.8 Flash TTS
Флагманская модель Google для выразительной озвучки текста: голоса по описанию или по записи, диалоги двух персонажей
вышла 23 сентября
Рейтинг Voice Arena
| Рейтинг | Место | Оценка |
|---|---|---|
| Синтез речи · английский (США) | 3-е из 20 | рейтинг 1061 ± 12, 1 161 оценка |
| Синтез речи · хинди | 1-е из 18 | рейтинг 1106 ± 16, 915 оценок |
| Синтез речи · португальский (Бразилия) | 2-е из 12 | рейтинг 1104 ± 14, 712 оценок |
| Синтез речи · испанский (Мексика) | 1-е из 11 | рейтинг 1152 ± 19, 687 оценок |
| Синтез речи · японский | 1-е из 9 | рейтинг 1209 ± 21, 698 оценок |
| Синтез речи · арабский литературный | 1-е из 9 | рейтинг 1204 ± 22, 692 оценки |
| Синтез речи · вьетнамский | 2-е из 9 | рейтинг 1135 ± 17, 690 оценок |
Синтез речи вслепую сравнивают парами носители языка, распознавание оценивают по доле ошибок в словах. Русский язык Voice Arena не оценивает. Данные: Voice Arena, обновлены 26 сентября.
Характеристики
- Вышла
- 23 сентября
- Понимает
- текст, аудио
- Отвечает
- аудио
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- —
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- —
- ВесаОткрытые — файлы модели выложены в свободный доступ, и запускать и дообучать её могут не только авторы. Небольшие модели работают на обычном компьютере. Большим нужны серверы с дорогими видеокартами: такие модели разворачивают компании и облачные сервисы, а остальные пользуются ими через них. Закрытые — доступ только через сервис лаборатории
- —
- Идентификатор в API
- gemini-3.8-flash-tts
Что это за модель
Gemini 3.8 Flash TTS — модель Google для синтеза речи (TTS, text-to-speech): она превращает текст в звучащую речь. Google выпустила её вместе с облегчённой Gemini 3.8 Flash-Lite TTS и в документации называет своей флагманской моделью озвучки для творческих задач. Язык текста модель определяет сама. В анонсе говорится о более чем 100 языках и диалектах, в документации для разработчиков — о свыше 130 языках, включая региональные акценты и диалекты языковых меньшинств.
Голос можно взять готовый: в библиотеке их больше 2000. Можно создать новый по описанию в одно-два предложения: возраст, тембр, акцент, манера речи. Такой голос сохраняется под постоянным идентификатором, в одном проекте их может быть до 200, и хранятся они год. Ещё модель копирует существующий голос по записи длиной 30 секунд, но только если владелец голоса вслух дал согласие и это согласие записано. Сценарий размечается по репликам: к каждой можно добавить указание, как её произнести, а прямо в тексте отметить смех, вздох или паузу. Модель умеет разыгрывать сцену с двумя говорящими.
По словам Google, по сравнению с Gemini 3.1 Flash TTS модель заметно лучше справляется с длинными текстами и диалогами двух персонажей. На многоминутной озвучке голос не «плывёт»: сохраняются тембр, громкость и звучание помещения. По данным компании, модель заняла первое место в бенчмарке Voice Design Benchmark от Hume AI с баллом 71,4 и лидирует там в передаче акцентов (60,8). Её берут для игр, аудиокниг, подкастов и интерактивных медиа, где важна актёрская подача. Flash-Lite TTS рассчитана на большие объёмы: она дешевле и отвечает быстрее, поэтому подходит для дубляжа и голосовых агентов.
Модель умеет только озвучивать. Она не рассуждает, не вызывает внешние функции, не ищет в интернете и не работает в режиме живого разговора: для этого у Google есть Gemini 3.8 Live. Весь звук, который она создаёт, помечается водяным знаком SynthID — незаметной на слух меткой, по которой можно распознать синтезированную речь. Копирование голоса недоступно в Иллинойсе, Техасе, Европейской экономической зоне, Великобритании, Швейцарии и Индии. Разработчикам, которые переходят с версии 3.1, придётся переделать запросы: указания к репликам теперь передаются отдельным полем, а звук по умолчанию приходит готовым WAV-файлом.
Источники: Анонс Gemini 3.8 Flash TTS и Flash-Lite TTS в блоге Google, Страница модели в документации Gemini API, Создание голоса по описанию: документация
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).