Модель · Google
Gemini 2.5 Flash Preview TTS
Предварительная версия модели Google для синтеза речи: озвучивает текст одним или двумя голосами, тон и темп задаются словами
вышла 1 мая 2025
Характеристики
- Вышла
- 1 мая 2025
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 8,2 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 16 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,50 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $10 за миллион токенов
- Понимает
- текст
- Отвечает
- аудио
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- январь 2025
- Идентификатор в API
- gemini-2.5-flash-preview-tts
Что это за модель
Gemini 2.5 Flash Preview TTS — модель Google для синтеза речи, то есть для превращения текста в звук. Она принимает только текст и возвращает только аудио. Модель вышла весной 2025 года как предварительная версия вместе с более крупной Gemini 2.5 Pro Preview TTS. Flash — более быстрый и дешёвый вариант из этой пары.
Главное отличие от обычных синтезаторов речи — управление обычными словами. В запросе можно описать, как читать текст: с каким настроением, акцентом, темпом и тоном. Кроме того, в текст можно вставлять метки в квадратных скобках, например с указанием говорить шёпотом или засмеяться. По документации, у модели 30 готовых голосов с разным характером: яркий, бодрый, твёрдый, с придыханием. Она работает более чем с 90 языками и сама определяет язык текста.
Модель умеет озвучивать диалог двух собеседников: каждому назначается свой голос и свои указания по манере речи. Поэтому её берут для озвучки статей и книг, подкастов в форме беседы, голосовых подсказок в приложениях и обучающих материалов. Позже Google выпустила обновление этих моделей: по словам компании, они стали выразительнее, точнее держат заданный стиль и темп и сохраняют голоса персонажей в диалогах.
Сама Google называет несколько ограничений. Голос не всегда совпадает с указаниями из запроса. В записях длиннее нескольких минут качество может постепенно падать. Иногда запрос случайно завершается ошибкой, и его приходится повторять. Для живого разговора с пользователем Google предлагает другие модели — с встроенным голосом через Live API, а эта модель рассчитана на озвучку готового текста.
Источники: Документация: генерация речи в Gemini API, Анонс на I/O: обновления Gemini API, Обновление моделей синтеза речи Gemini 2.5
Другие модели семейства
-
Gemini 3.8 Flash
Google16-е место в Epochконтекст 1 млн$0,75 / $3,75рассуждения
-
Gemini 3.7 Flash
Google12-е место в Epochконтекст 1 млн$0,75 / $3,75рассуждения
-
Gemini 3.6 Flash
Google31-е место в Epochконтекст 1 млн$0,75 / $3,75рассуждения
-
Nano Banana 2
Googleконтекст 65 тыс.$0,50 / $60рассуждения
-
Gemini 3.5 Flash
Google28-е место в Epochконтекст 1 млн$1,50 / $9рассуждения
-
Gemini 3.1 Flash TTS Preview
Googleконтекст 8,2 тыс.$1 / $20рассуждения
-
Gemini 3.1 Flash Live Preview
Googleконтекст 131 тыс.$0,75 / $4,50рассуждения
-
Gemini 3 Flash Preview
Google40-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
Данные: models.dev (MIT).