ИИтак

← Назад

Модель · Google

Gemini 3.1 Flash TTS Preview

Предварительная версия модели Google для синтеза речи: озвучивает текст, а тон, темп и эмоции задаются обычными словами

вышла 15 апреля

Характеристики

Вышла
15 апреля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
8,2 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 16 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$1 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$20 за миллион токенов
Понимает
текст
Отвечает
аудио
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
январь 2025
Идентификатор в API
gemini-3.1-flash-tts-preview

Что это за модель

Gemini 3.1 Flash TTS — модель Google для синтеза речи, то есть для превращения текста в звук. Внутри у неё большая языковая модель, поэтому она понимает не только что сказать, но и как: голосом можно управлять обычным текстовым запросом. Сейчас модель доступна как предварительная версия в Gemini API, Google AI Studio, Vertex AI и в Google Vids.

Главное отличие от линейки Gemini 2.5 TTS — точное управление подачей. Прямо в текст можно вставлять звуковые теги в квадратных скобках: попросить сказать фразу шёпотом, радостно или со смехом. Всего таких тегов больше двухсот. В AI Studio можно описать сцену, задать каждому говорящему характер и режиссёрские заметки, а потом одной кнопкой получить готовый код для API. Ещё в 3.1 появилась потоковая выдача: звук начинает приходить до того, как сгенерирован весь фрагмент. В рейтинге синтеза речи Artificial Analysis модель, по данным Google, набрала 1211 очков Elo.

Модель берут для озвучки роликов, подкастов, голосовых помощников и обучающих материалов. Она умеет вести диалог двух голосов, на выбор есть 30 готовых голосов с разным характером. Google заявляет поддержку более 70 языков, язык текста модель определяет сама.

Ограничения Google называет в документации. Говорящих в одном запросе может быть не больше двух. Иногда модель вместо звука возвращает текст, и запрос приходится повторять. Если указания в запросе расходятся с характером выбранного голоса, звучание может стать непоследовательным, а на записях длиннее нескольких минут качество может «поплыть». Весь сгенерированный звук помечается невидимым водяным знаком SynthID, чтобы синтезированную речь можно было распознать.

Источники: Анонс в блоге Google, Документация по синтезу речи в Gemini API

Другие модели семейства

Новости о модели

  1. 01

    Cohere выпустила открытую модель-переводчик North Small Translate: по её тестам она обходит DeepL и Google

    Cohere

  2. 02

    Агенты DeepMind нашли дыру в проверке доказательств, и за 27 минут жульничество охватило рой

    Import AI

  3. 03

    DiG-bench: модели угадывают скрытые правила игр, но пока сильно отстают от людей

    Import AI

все 3 новости о Gemini 3.1 →

Данные: models.dev (MIT).