Модель · Google
Gemini 3.1 Flash Live Preview
Устаревшая предварительная версия голосовой модели Google для живого диалога в реальном времени; её сменила Gemini 3.8 Live
вышла 26 марта
Характеристики
- Вышла
- 26 марта
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 131 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 65 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $0,75 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $4,50 за миллион токенов
- Понимает
- текст, изображения, видео, аудио
- Отвечает
- текст, аудио
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- да
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- да
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- январь 2025
- Идентификатор в API
- gemini-3.1-flash-live-preview
Что это за модель
Gemini 3.1 Flash Live — голосовая модель Google для разговора в реальном времени. Она слушает речь и может смотреть на картинку с камеры или экрана, а отвечает голосом или текстом почти без паузы. Разработчики подключаются к ней через Live API — интерфейс, который держит открытое соединение на всё время разговора. На этой же модели работают потребительские сервисы Google: Gemini Live и голосовой поиск Search Live.
Её предшественница — Gemini 2.5 Flash Native Audio. Google заявляет, что новая модель отвечает быстрее и говорит в более естественном ритме. Она лучше слышит высоту и темп голоса и замечает, когда собеседник раздражён или запутался. Кроме того, она держит в памяти разговор вдвое длиннее прежнего. Модель может немного подумать перед ответом, и глубину этих рассуждений задаёт разработчик. По умолчанию стоит минимальная глубина, чтобы задержка была как можно меньше.
Её берут для голосовых ассистентов и агентов, например для службы поддержки, которая по ходу разговора обращается к внешним системам. По замерам Google, в тесте ComplexFuncBench Audio на многошаговый вызов функций голосом модель набрала 90,8%. В тесте Audio MultiChallenge от Scale AI, где проверяют выполнение сложных инструкций в долгом разговоре, у неё 36,1% с включёнными рассуждениями. Модель многоязычная. Весь синтезированный ею звук Google помечает незаметным водяным знаком SynthID, чтобы сгенерированную речь можно было распознать.
Возможности у неё урезаны по сравнению с обычными текстовыми моделями Gemini. Нет кэша, выполнения кода, поиска по файлам, структурированного ответа, опоры на Google Maps и чтения страниц по ссылке. Асинхронный вызов функций она не поддерживает: пока программа не вернёт результат инструмента, модель молчит. Сейчас Google числит её устаревшей предварительной версией и для большинства голосовых агентов советует переходить на Gemini 3.8 Live.
Источники: Анонс Gemini 3.1 Flash Live в блоге Google, Страница модели в документации Gemini API
Другие модели семейства
-
Gemini 3.8 Flash
Google16-е место в Epochконтекст 1 млн$0,75 / $3,75рассуждения
-
Gemini 3.7 Flash
Google12-е место в Epochконтекст 1 млн$0,75 / $3,75рассуждения
-
Gemini 3.6 Flash
Google31-е место в Epochконтекст 1 млн$0,75 / $3,75рассуждения
-
Nano Banana 2
Googleконтекст 65 тыс.$0,50 / $60рассуждения
-
Gemini 3.5 Flash
Google28-е место в Epochконтекст 1 млн$1,50 / $9рассуждения
-
Gemini 3.1 Flash TTS Preview
Googleконтекст 8,2 тыс.$1 / $20рассуждения
-
Gemini 3 Flash Preview
Google40-е место в Epochконтекст 1 млн$0,50 / $3рассуждения
-
Nano Banana
Googleконтекст 32 тыс.$0,30 / $30рассуждения
Новости о модели
- 01
- 02
- 03
Данные: models.dev (MIT).