ИИтак

← Назад

Модель · Google

Gemini 3.1 Flash Live Preview

Устаревшая предварительная версия голосовой модели Google для живого диалога в реальном времени; её сменила Gemini 3.8 Live

вышла 26 марта

Характеристики

Вышла
26 марта
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
131 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 65 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$0,75 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$4,50 за миллион токенов
Понимает
текст, изображения, видео, аудио
Отвечает
текст, аудио
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
январь 2025
Идентификатор в API
gemini-3.1-flash-live-preview

Что это за модель

Gemini 3.1 Flash Live — голосовая модель Google для разговора в реальном времени. Она слушает речь и может смотреть на картинку с камеры или экрана, а отвечает голосом или текстом почти без паузы. Разработчики подключаются к ней через Live API — интерфейс, который держит открытое соединение на всё время разговора. На этой же модели работают потребительские сервисы Google: Gemini Live и голосовой поиск Search Live.

Её предшественница — Gemini 2.5 Flash Native Audio. Google заявляет, что новая модель отвечает быстрее и говорит в более естественном ритме. Она лучше слышит высоту и темп голоса и замечает, когда собеседник раздражён или запутался. Кроме того, она держит в памяти разговор вдвое длиннее прежнего. Модель может немного подумать перед ответом, и глубину этих рассуждений задаёт разработчик. По умолчанию стоит минимальная глубина, чтобы задержка была как можно меньше.

Её берут для голосовых ассистентов и агентов, например для службы поддержки, которая по ходу разговора обращается к внешним системам. По замерам Google, в тесте ComplexFuncBench Audio на многошаговый вызов функций голосом модель набрала 90,8%. В тесте Audio MultiChallenge от Scale AI, где проверяют выполнение сложных инструкций в долгом разговоре, у неё 36,1% с включёнными рассуждениями. Модель многоязычная. Весь синтезированный ею звук Google помечает незаметным водяным знаком SynthID, чтобы сгенерированную речь можно было распознать.

Возможности у неё урезаны по сравнению с обычными текстовыми моделями Gemini. Нет кэша, выполнения кода, поиска по файлам, структурированного ответа, опоры на Google Maps и чтения страниц по ссылке. Асинхронный вызов функций она не поддерживает: пока программа не вернёт результат инструмента, модель молчит. Сейчас Google числит её устаревшей предварительной версией и для большинства голосовых агентов советует переходить на Gemini 3.8 Live.

Источники: Анонс Gemini 3.1 Flash Live в блоге Google, Страница модели в документации Gemini API

Другие модели семейства

Новости о модели

  1. 01

    Cohere выпустила открытую модель-переводчик North Small Translate: по её тестам она обходит DeepL и Google

    Cohere

  2. 02

    Агенты DeepMind нашли дыру в проверке доказательств, и за 27 минут жульничество охватило рой

    Import AI

  3. 03

    DiG-bench: модели угадывают скрытые правила игр, но пока сильно отстают от людей

    Import AI

все 3 новости о Gemini 3.1 →

Данные: models.dev (MIT).