ИИтак

← Назад

Модель · Google

Gemini 3.8 Flash-Lite TTS

Лёгкая и недорогая модель Google для массовой озвучки текста: дубляж, голосовые агенты, чтение вслух

вышла 23 сентября

Рейтинг Voice Arena

РейтингМестоОценка
Синтез речи · английский (США) 1-е из 20 рейтинг 1087 ± 15, 636 оценок
Синтез речи · хинди 4-е из 18 рейтинг 1076 ± 15, 949 оценок
Синтез речи · португальский (Бразилия) 1-е из 12 рейтинг 1134 ± 16, 634 оценки
Синтез речи · испанский (Мексика) 2-е из 11 рейтинг 1145 ± 21, 597 оценок
Синтез речи · японский 2-е из 9 рейтинг 1152 ± 21, 594 оценки
Синтез речи · арабский литературный 2-е из 9 рейтинг 1181 ± 19, 590 оценок
Синтез речи · вьетнамский 1-е из 9 рейтинг 1156 ± 19, 581 оценка

Синтез речи вслепую сравнивают парами носители языка, распознавание оценивают по доле ошибок в словах. Русский язык Voice Arena не оценивает. Данные: Voice Arena, обновлены 26 сентября.

Характеристики

Вышла
23 сентября
Понимает
текст
Отвечает
аудио
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
—
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
—
ВесаОткрытые — файлы модели выложены в свободный доступ, и запускать и дообучать её могут не только авторы. Небольшие модели работают на обычном компьютере. Большим нужны серверы с дорогими видеокартами: такие модели разворачивают компании и облачные сервисы, а остальные пользуются ими через них. Закрытые — доступ только через сервис лаборатории
—
Идентификатор в API
gemini-3.8-flash-lite-tts

Что это за модель

Gemini 3.8 Flash-Lite TTS — модель синтеза речи (TTS, от text-to-speech — превращение текста в речь). Google выпустила её вместе с Gemini 3.8 Flash TTS и называет быстрой и экономной «рабочей лошадкой» для больших объёмов. Язык текста модель определяет сама и говорит больше чем на 100 языках. Тон, темп и подачу отдельных реплик задают обычными словами в запросе. В текст можно вставлять и неречевые звуки, например смех или вздох.

Старшая модель пары, Flash TTS, рассчитана на творческую работу: персонажей для игр, аудиокниги, подкасты, голоса, созданные с нуля по описанию. По документации, она точнее передаёт голос и актёрские оттенки и знает около 130 языков. Lite уступает ей в этом ради скорости, низкой задержки и цены. API у обеих одинаковый, поэтому, чтобы перейти с одной на другую, достаточно поменять один параметр. Google рекомендует Lite вместо прежней предварительной версии gemini-3.1-flash-tts-preview. Компания ссылается на оценки Hume AI: там Lite заняла второе место по общему индексу качества (Overall Quality Index).

Её берут для автоматического дубляжа видео, потоковой озвучки переводов и функций чтения вслух. Ещё один сценарий — голосовые агенты, то есть программы, которые разговаривают с клиентами. В такой связке речь распознаёт одна модель, ответ пишет языковая, а озвучивает его Flash-Lite TTS. Разработчикам доступна библиотека из более чем 2000 готовых голосов с региональными акцентами. Можно создать голос по описанию или скопировать чужой по 30-секундной записи. Длинные задания модель принимает пакетами, а обычные пользователи встретят её в редакторе видео Google Vids.

Модель только озвучивает текст: она не рассуждает, не вызывает внешние функции и не ведёт живой разговор. Для диалога в реальном времени у Google есть Gemini 3.8 Live. Лучше всего Lite справляется с речью одного диктора. Скопировать голос можно только с согласием владельца, записанным его голосом. В Google AI Studio эта функция не работает в Иллинойсе, Техасе, Европейской экономической зоне, Великобритании, Швейцарии и Индии. Во весь созданный звук встраивается неслышимый водяной знак SynthID, по которому можно распознать синтезированную речь.

Источники: Анонс Gemini 3.8 Flash TTS и Flash-Lite TTS в блоге Google, Карточка модели в документации Gemini API, Руководство по синтезу речи в Gemini API

Новости о модели

  1. 01

    Google добавила голосовой модели Gemini 3.8 Live видеоаватар для бизнеса

    Google DeepMind

  2. 02

    Саймон Уиллисон сделал страницу для озвучки диалогов моделями Gemini 3.8

    Саймон Уиллисон

  3. 03

    Модели озвучки Gemini 3.8 создают голоса по описанию и копируют по записи

    Google DeepMind

  4. 04

    Google встроила голосовую Gemini 3.8 Live в Gmail, Docs и поиск. Кому это доступно

    Google DeepMind

  5. 05

    Google выпустила голосовые модели Gemini 3.8 Live для разработчиков

    Google для разработчиков

  6. 06

    Google выпустила модель Gemini 3.8 Flash для программирования и агентов

    Google DeepMind

все упоминания Gemini 3.8 — 14 →

Данные: models.dev (MIT).