Модель · Google
Gemini 2.5 Pro Preview TTS
Превью-модель Google для синтеза речи: озвучивает текст одним или двумя голосами, манеру чтения задают словами
вышла 1 мая 2025
Характеристики
- Вышла
- 1 мая 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 8,2 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 16 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $1 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $20 за миллион токенов
- Понимает
- текст
- Отвечает
- аудио
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- январь 2025
- Идентификатор в API
- gemini-2.5-pro-preview-tts
Что это за модель
Gemini 2.5 Pro Preview TTS — модель Google для синтеза речи, то есть для превращения текста в звук. Ей дают только текст, а возвращает она только аудио. Модель вышла в статусе предварительной версии. Google представила её на конференции I/O в мае 2025 года вместе с более лёгкой Gemini 2.5 Flash TTS.
От классических синтезаторов речи её отличает управление обычными словами. В запросе можно описать тон, акцент, темп и манеру подачи: например, попросить прочитать фразу шёпотом или бодро. Документация советует задавать «профиль голоса», описывать сцену и добавлять заметки, как режиссёр для актёра. Модель умеет читать текст одним голосом или разыгрывать диалог двух собеседников с разными голосами. На выбор есть 30 готовых голосов. Язык текста модель определяет сама.
Модель подходит для озвучки статей и книг, подкастов с двумя ведущими, обучающих материалов и других задач, где важна выразительная подача. Для живого разговора с голосовым помощником в реальном времени Google предлагает другие модели — с встроенным аудио в Live API.
Сама Google называет ограничения. Иногда модель возвращает текст вместо звука, и тогда запрос завершается ошибкой. Если запись длиннее нескольких минут, качество и ровность голоса могут «поплыть». Позже у Google вышла Gemini 3.1 Flash TTS Preview с теми же основными возможностями.
Источники: Анонс на I/O: обновления Gemini API, Документация: синтез речи в Gemini API, Блог Google об обновлении аудиомоделей
Другие модели семейства
-
Gemini 3.8 Flash
Google16-е место в Epochконтекст 1 млн$0,75 / $3,75рассуждения
-
Gemini 3.7 Flash
Google12-е место в Epochконтекст 1 млн$0,75 / $3,75рассуждения
-
Gemini 3.6 Flash
Google31-е место в Epochконтекст 1 млн$0,75 / $3,75рассуждения
-
Nano Banana 2
Googleконтекст 65 тыс.$0,50 / $60рассуждения
-
Gemini 3.5 Flash
Google28-е место в Epochконтекст 1 млн$1,50 / $9рассуждения
-
Gemini 3.1 Flash TTS Preview
Googleконтекст 8,2 тыс.$1 / $20рассуждения
-
Gemini 3.1 Flash Live Preview
Googleконтекст 131 тыс.$0,75 / $4,50рассуждения
-
Gemini 3 Flash Preview
Google40-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Данные: models.dev (MIT).