ИИтак

← Назад

Модель · Google

Gemini 2.5 Flash Preview TTS

Предварительная версия модели Google для синтеза речи: озвучивает текст одним или двумя голосами, тон и темп задаются словами

вышла 1 мая 2025

Характеристики

Вышла
1 мая 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
8,2 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 16 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,50 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$10 за миллион токенов
Понимает
текст
Отвечает
аудио
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
январь 2025
Идентификатор в API
gemini-2.5-flash-preview-tts

Что это за модель

Gemini 2.5 Flash Preview TTS — модель Google для синтеза речи, то есть для превращения текста в звук. Она принимает только текст и возвращает только аудио. Модель вышла весной 2025 года как предварительная версия вместе с более крупной Gemini 2.5 Pro Preview TTS. Flash — более быстрый и дешёвый вариант из этой пары.

Главное отличие от обычных синтезаторов речи — управление обычными словами. В запросе можно описать, как читать текст: с каким настроением, акцентом, темпом и тоном. Кроме того, в текст можно вставлять метки в квадратных скобках, например с указанием говорить шёпотом или засмеяться. По документации, у модели 30 готовых голосов с разным характером: яркий, бодрый, твёрдый, с придыханием. Она работает более чем с 90 языками и сама определяет язык текста.

Модель умеет озвучивать диалог двух собеседников: каждому назначается свой голос и свои указания по манере речи. Поэтому её берут для озвучки статей и книг, подкастов в форме беседы, голосовых подсказок в приложениях и обучающих материалов. Позже Google выпустила обновление этих моделей: по словам компании, они стали выразительнее, точнее держат заданный стиль и темп и сохраняют голоса персонажей в диалогах.

Сама Google называет несколько ограничений. Голос не всегда совпадает с указаниями из запроса. В записях длиннее нескольких минут качество может постепенно падать. Иногда запрос случайно завершается ошибкой, и его приходится повторять. Для живого разговора с пользователем Google предлагает другие модели — с встроенным голосом через Live API, а эта модель рассчитана на озвучку готового текста.

Источники: Документация: генерация речи в Gemini API, Анонс на I/O: обновления Gemini API, Обновление моделей синтеза речи Gemini 2.5

Другие модели семейства

Данные: models.dev (MIT).