Модель · Google
Gemini 3.5 Live Translate Preview
Предварительная версия голосовой модели Google для синхронного перевода устной речи на 70 с лишним языках
вышла 9 июня
Характеристики
- Вышла
- 9 июня
- КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
- 16 тыс. токенов
- Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
- до 32 тыс. токенов
- Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
- $3,50 за миллион токенов
- Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
- $21 за миллион токенов
- Понимает
- аудио
- Отвечает
- аудио, текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Знания до
- январь 2025
- Идентификатор в API
- gemini-3.5-live-translate-preview
Что это за модель
Gemini 3.5 Live Translate — специализированная модель Google для перевода живой речи. Она слушает поток звука и почти сразу выдаёт перевод голосом. Модель не ждёт, пока человек договорит, как это делают переводчики, работающие по репликам. Она переводит на ходу и отстаёт от говорящего, по словам Google, всего на несколько секунд. Согласно карточке модели, она построена на основе Gemini 3 Pro.
Главное отличие от прежних решений Google — число языков и их сочетаний. Раньше перевод речи в Google Meet поддерживал всего пять языков и шёл через английский как промежуточный. Новая модель сама распознаёт больше 70 языков и переводит между ними напрямую, это больше 2000 языковых пар в одной встрече. Кроме того, Google заявляет, что модель сохраняет интонацию, темп и высоту голоса говорящего и справляется с шумом вокруг. В отличие от голосовых агентов линейки Gemini Live, она ничего не делает, кроме перевода.
Модель берут для многоязычных звонков, деловых встреч, занятий и трансляций. Её уже используют Google Translate на Android и iOS и Google Meet, а разработчикам она доступна через Gemini Live API и Google AI Studio. Компания Grab проверяет её для общения водителей с путешественниками. Вместе с переведённым звуком модель может выдавать текстовую расшифровку и исходной речи, и перевода. Звук, который она генерирует, помечается водяным знаком SynthID, чтобы его можно было опознать как созданный ИИ.
Ограничения Google называет сама. Модель принимает только звук: текст на перевод отправить нельзя. Она не вызывает инструменты и не следует инструкциям. Голос перевода может смениться после паузы, иногда модель ошибается с полом говорящего. Язык она хуже определяет при сильном акценте, у близких языков или при частом переключении между ними. Также возможны галлюцинации, то есть выдуманный текст, и обрывы по тайм-ауту.
Источники: Анонс в блоге Google, Документация: перевод через Gemini Live API, Карточка модели Gemini 3.5 Audio
Другие модели семейства
-
Nano Banana Pro
Googleконтекст 131 тыс.$2 / $120рассуждения
-
Deep Research Max Preview
Googleконтекст 131 тыс.$2 / $12рассуждения
-
Deep Research Preview
Googleконтекст 131 тыс.$2 / $12рассуждения
-
Gemini 3.1 Pro Preview
Google27-е место в Epochконтекст 1 млн$2 / $12рассуждения
-
Gemini 3.1 Pro Preview Custom Tools
Google27-е место в Epochконтекст 1 млн$2 / $12рассуждения
-
Gemini 2.5 Computer Use Preview 10-2025
Googleконтекст 131 тыс.$1,25 / $10рассуждения
-
Gemini 2.5 Pro
Google76-е место в Epochконтекст 1 млн$1,25 / $10рассуждения
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).