ИИтак

← Назад

Модель · Google

Gemini 3.5 Live Translate Preview

Предварительная версия голосовой модели Google для синхронного перевода устной речи на 70 с лишним языках

вышла 9 июня

Характеристики

Вышла
9 июня
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
16 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 32 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$3,50 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$21 за миллион токенов
Понимает
аудио
Отвечает
аудио, текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
январь 2025
Идентификатор в API
gemini-3.5-live-translate-preview

Что это за модель

Gemini 3.5 Live Translate — специализированная модель Google для перевода живой речи. Она слушает поток звука и почти сразу выдаёт перевод голосом. Модель не ждёт, пока человек договорит, как это делают переводчики, работающие по репликам. Она переводит на ходу и отстаёт от говорящего, по словам Google, всего на несколько секунд. Согласно карточке модели, она построена на основе Gemini 3 Pro.

Главное отличие от прежних решений Google — число языков и их сочетаний. Раньше перевод речи в Google Meet поддерживал всего пять языков и шёл через английский как промежуточный. Новая модель сама распознаёт больше 70 языков и переводит между ними напрямую, это больше 2000 языковых пар в одной встрече. Кроме того, Google заявляет, что модель сохраняет интонацию, темп и высоту голоса говорящего и справляется с шумом вокруг. В отличие от голосовых агентов линейки Gemini Live, она ничего не делает, кроме перевода.

Модель берут для многоязычных звонков, деловых встреч, занятий и трансляций. Её уже используют Google Translate на Android и iOS и Google Meet, а разработчикам она доступна через Gemini Live API и Google AI Studio. Компания Grab проверяет её для общения водителей с путешественниками. Вместе с переведённым звуком модель может выдавать текстовую расшифровку и исходной речи, и перевода. Звук, который она генерирует, помечается водяным знаком SynthID, чтобы его можно было опознать как созданный ИИ.

Ограничения Google называет сама. Модель принимает только звук: текст на перевод отправить нельзя. Она не вызывает инструменты и не следует инструкциям. Голос перевода может смениться после паузы, иногда модель ошибается с полом говорящего. Язык она хуже определяет при сильном акценте, у близких языков или при частом переключении между ними. Также возможны галлюцинации, то есть выдуманный текст, и обрывы по тайм-ауту.

Источники: Анонс в блоге Google, Документация: перевод через Gemini Live API, Карточка модели Gemini 3.5 Audio

Другие модели семейства

Новости о модели

  1. 01

    Alibaba выпустила Qwen3.8-Omni-Flash — модель, которая смотрит видео, слушает звук и работает с инструментами

    Qwen · X

  2. 02

    Google выпустила голосовые модели Gemini 3.8 Live: агент работает, не прерывая разговор

    Google для разработчиков

  3. 03

    Google подвела итоги работы над языками: 300 языков, офлайн-перевод и Gemini на кнопочных телефонах

    Google AI

  4. 04

    Cohere выпустила открытую модель-переводчик North Small Translate: по её тестам она обходит DeepL и Google

    Cohere

  5. 05

    Приложением Gemini пользуются больше миллиарда человек в месяц: итоги августа у Google

    Google AI

  6. 06

    Gemini научилась сама выбирать, какие фрагменты видео смотреть, и тратит до 88% меньше токенов

    Google DeepMind

все 8 новостей о Gemini 3.5 →

Данные: models.dev (MIT).