ИИтак

← Назад

Модель · Google

Gemini 2.5 Pro Preview TTS

Превью-модель Google для синтеза речи: озвучивает текст одним или двумя голосами, манеру чтения задают словами

вышла 1 мая 2025

Характеристики

Вышла
1 мая 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
8,2 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 16 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$20 за миллион токенов
Понимает
текст
Отвечает
аудио
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
январь 2025
Идентификатор в API
gemini-2.5-pro-preview-tts

Что это за модель

Gemini 2.5 Pro Preview TTS — модель Google для синтеза речи, то есть для превращения текста в звук. Ей дают только текст, а возвращает она только аудио. Модель вышла в статусе предварительной версии. Google представила её на конференции I/O в мае 2025 года вместе с более лёгкой Gemini 2.5 Flash TTS.

От классических синтезаторов речи её отличает управление обычными словами. В запросе можно описать тон, акцент, темп и манеру подачи: например, попросить прочитать фразу шёпотом или бодро. Документация советует задавать «профиль голоса», описывать сцену и добавлять заметки, как режиссёр для актёра. Модель умеет читать текст одним голосом или разыгрывать диалог двух собеседников с разными голосами. На выбор есть 30 готовых голосов. Язык текста модель определяет сама.

Модель подходит для озвучки статей и книг, подкастов с двумя ведущими, обучающих материалов и других задач, где важна выразительная подача. Для живого разговора с голосовым помощником в реальном времени Google предлагает другие модели — с встроенным аудио в Live API.

Сама Google называет ограничения. Иногда модель возвращает текст вместо звука, и тогда запрос завершается ошибкой. Если запись длиннее нескольких минут, качество и ровность голоса могут «поплыть». Позже у Google вышла Gemini 3.1 Flash TTS Preview с теми же основными возможностями.

Источники: Анонс на I/O: обновления Gemini API, Документация: синтез речи в Gemini API, Блог Google об обновлении аудиомоделей

Другие модели семейства

Данные: models.dev (MIT).