Модель · Google
Gemini 3.1 Flash TTS Preview
Предварительная версия модели Google для синтеза речи: озвучивает текст, а тон, темп и эмоции задаются обычными словами
вышла 15 апреля
Характеристики
- Вышла
- 15 апреля
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 8,2 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 16 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $1 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $20 за миллион токенов
- Понимает
- текст
- Отвечает
- аудио
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- январь 2025
- Идентификатор в API
- gemini-3.1-flash-tts-preview
Что это за модель
Gemini 3.1 Flash TTS — модель Google для синтеза речи, то есть для превращения текста в звук. Внутри у неё большая языковая модель, поэтому она понимает не только что сказать, но и как: голосом можно управлять обычным текстовым запросом. Сейчас модель доступна как предварительная версия в Gemini API, Google AI Studio, Vertex AI и в Google Vids.
Главное отличие от линейки Gemini 2.5 TTS — точное управление подачей. Прямо в текст можно вставлять звуковые теги в квадратных скобках: попросить сказать фразу шёпотом, радостно или со смехом. Всего таких тегов больше двухсот. В AI Studio можно описать сцену, задать каждому говорящему характер и режиссёрские заметки, а потом одной кнопкой получить готовый код для API. Ещё в 3.1 появилась потоковая выдача: звук начинает приходить до того, как сгенерирован весь фрагмент. В рейтинге синтеза речи Artificial Analysis модель, по данным Google, набрала 1211 очков Elo.
Модель берут для озвучки роликов, подкастов, голосовых помощников и обучающих материалов. Она умеет вести диалог двух голосов, на выбор есть 30 готовых голосов с разным характером. Google заявляет поддержку более 70 языков, язык текста модель определяет сама.
Ограничения Google называет в документации. Говорящих в одном запросе может быть не больше двух. Иногда модель вместо звука возвращает текст, и запрос приходится повторять. Если указания в запросе расходятся с характером выбранного голоса, звучание может стать непоследовательным, а на записях длиннее нескольких минут качество может «поплыть». Весь сгенерированный звук помечается невидимым водяным знаком SynthID, чтобы синтезированную речь можно было распознать.
Источники: Анонс в блоге Google, Документация по синтезу речи в Gemini API
Другие модели семейства
-
Gemini 3.8 Flash
Google16-е место в Epochконтекст 1 млн$0,75 / $3,75рассуждения
-
Gemini 3.7 Flash
Google12-е место в Epochконтекст 1 млн$0,75 / $3,75рассуждения
-
Gemini 3.6 Flash
Google31-е место в Epochконтекст 1 млн$0,75 / $3,75рассуждения
-
Nano Banana 2
Googleконтекст 65 тыс.$0,50 / $60рассуждения
-
Gemini 3.5 Flash
Google28-е место в Epochконтекст 1 млн$1,50 / $9рассуждения
-
Gemini 3.1 Flash Live Preview
Googleконтекст 131 тыс.$0,75 / $4,50рассуждения
-
Gemini 3 Flash Preview
Google40-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Nano Banana
Googleконтекст 32 тыс.$0,30 / $30рассуждения
Новости о модели
- 01
- 02
- 03
Данные: models.dev (MIT).