ИИтак

← Назад

Модель · Google

Gemini 3.8 Flash TTS

Флагманская модель Google для выразительной озвучки текста: голоса по описанию или по записи, диалоги двух персонажей

вышла 23 сентября

Рейтинг Voice Arena

РейтингМестоОценка
Синтез речи · английский (США) 3-е из 20 рейтинг 1061 ± 12, 1 161 оценка
Синтез речи · хинди 1-е из 18 рейтинг 1106 ± 16, 915 оценок
Синтез речи · португальский (Бразилия) 2-е из 12 рейтинг 1104 ± 14, 712 оценок
Синтез речи · испанский (Мексика) 1-е из 11 рейтинг 1152 ± 19, 687 оценок
Синтез речи · японский 1-е из 9 рейтинг 1209 ± 21, 698 оценок
Синтез речи · арабский литературный 1-е из 9 рейтинг 1204 ± 22, 692 оценки
Синтез речи · вьетнамский 2-е из 9 рейтинг 1135 ± 17, 690 оценок

Синтез речи вслепую сравнивают парами носители языка, распознавание оценивают по доле ошибок в словах. Русский язык Voice Arena не оценивает. Данные: Voice Arena, обновлены 26 сентября.

Характеристики

Вышла
23 сентября
Понимает
текст, аудио
Отвечает
аудио
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
—
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
—
ВесаОткрытые — файлы модели выложены в свободный доступ, и запускать и дообучать её могут не только авторы. Небольшие модели работают на обычном компьютере. Большим нужны серверы с дорогими видеокартами: такие модели разворачивают компании и облачные сервисы, а остальные пользуются ими через них. Закрытые — доступ только через сервис лаборатории
—
Идентификатор в API
gemini-3.8-flash-tts

Что это за модель

Gemini 3.8 Flash TTS — модель Google для синтеза речи (TTS, text-to-speech): она превращает текст в звучащую речь. Google выпустила её вместе с облегчённой Gemini 3.8 Flash-Lite TTS и в документации называет своей флагманской моделью озвучки для творческих задач. Язык текста модель определяет сама. В анонсе говорится о более чем 100 языках и диалектах, в документации для разработчиков — о свыше 130 языках, включая региональные акценты и диалекты языковых меньшинств.

Голос можно взять готовый: в библиотеке их больше 2000. Можно создать новый по описанию в одно-два предложения: возраст, тембр, акцент, манера речи. Такой голос сохраняется под постоянным идентификатором, в одном проекте их может быть до 200, и хранятся они год. Ещё модель копирует существующий голос по записи длиной 30 секунд, но только если владелец голоса вслух дал согласие и это согласие записано. Сценарий размечается по репликам: к каждой можно добавить указание, как её произнести, а прямо в тексте отметить смех, вздох или паузу. Модель умеет разыгрывать сцену с двумя говорящими.

По словам Google, по сравнению с Gemini 3.1 Flash TTS модель заметно лучше справляется с длинными текстами и диалогами двух персонажей. На многоминутной озвучке голос не «плывёт»: сохраняются тембр, громкость и звучание помещения. По данным компании, модель заняла первое место в бенчмарке Voice Design Benchmark от Hume AI с баллом 71,4 и лидирует там в передаче акцентов (60,8). Её берут для игр, аудиокниг, подкастов и интерактивных медиа, где важна актёрская подача. Flash-Lite TTS рассчитана на большие объёмы: она дешевле и отвечает быстрее, поэтому подходит для дубляжа и голосовых агентов.

Модель умеет только озвучивать. Она не рассуждает, не вызывает внешние функции, не ищет в интернете и не работает в режиме живого разговора: для этого у Google есть Gemini 3.8 Live. Весь звук, который она создаёт, помечается водяным знаком SynthID — незаметной на слух меткой, по которой можно распознать синтезированную речь. Копирование голоса недоступно в Иллинойсе, Техасе, Европейской экономической зоне, Великобритании, Швейцарии и Индии. Разработчикам, которые переходят с версии 3.1, придётся переделать запросы: указания к репликам теперь передаются отдельным полем, а звук по умолчанию приходит готовым WAV-файлом.

Источники: Анонс Gemini 3.8 Flash TTS и Flash-Lite TTS в блоге Google, Страница модели в документации Gemini API, Создание голоса по описанию: документация

Новости о модели

  1. 01

    Google добавила голосовой модели Gemini 3.8 Live видеоаватар для бизнеса

    Google DeepMind

  2. 02

    Саймон Уиллисон сделал страницу для озвучки диалогов моделями Gemini 3.8

    Саймон Уиллисон

  3. 03

    Модели озвучки Gemini 3.8 создают голоса по описанию и копируют по записи

    Google DeepMind

  4. 04

    Google встроила голосовую Gemini 3.8 Live в Gmail, Docs и поиск. Кому это доступно

    Google DeepMind

  5. 05

    Google выпустила голосовые модели Gemini 3.8 Live для разработчиков

    Google для разработчиков

  6. 06

    Google выпустила модель Gemini 3.8 Flash для программирования и агентов

    Google DeepMind

все упоминания Gemini 3.8 — 14 →

Данные: models.dev (MIT).