Модель · Google
Gemini 3.5 Transcribe
Модель Google для расшифровки речи в текст, из файлов и в реальном времени; пока предварительная версия
вышла 26 августа
Характеристики
- Вышла
- 26 августа
- Понимает
- аудио
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- нет
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- нет
- ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
- закрытые
- Идентификатор в API
- gemini-3.5-transcribe
Что это за модель
Gemini 3.5 Transcribe — модель Google для распознавания речи: она принимает звук и возвращает текст. Google называет её своей самой точной моделью для перевода речи в текст. Модель не просто записывает сказанное дословно, а выдаёт аккуратный отформатированный текст. Она убирает слова-паразиты и учитывает, когда человек поправляет сам себя. Есть два варианта: gemini-3.5-transcribe расшифровывает готовые аудиофайлы, а gemini-3.5-transcribe-live работает с потоком через Live API. Во втором случае текст приходит по кусочкам прямо во время разговора.
Google сравнивает модель с прошлой системой распознавания Chirp 3. По замерам компании, новая модель ошибается реже и в потоковом режиме, и при работе с файлами. Кроме того, финальная расшифровка, по данным Google, появляется на 70% быстрее. Модель сама определяет язык, всего их больше 85. Она справляется с акцентами и диалектами, а также с речью, где собеседники переходят с языка на язык посреди фразы.
Модель подходит для голосовых интерфейсов, диктовки, расшифровки встреч и звонков. Ей можно передать список до 1000 специальных терминов и необычных написаний, чтобы она распознавала их правильно. При работе с файлами она различает говорящих, то есть размечает, кто какую реплику произнёс, и ставит метки времени к каждому слову. Ещё модель умеет вызывать функции и передавать задачи другим моделям Gemini. Google встроила её в приложение Gemini для macOS, а разработчикам она доступна через Gemini API и Google AI Studio.
Модель вышла как предварительная версия. Потоковая сессия длится не дольше 10 минут. Файл можно загрузить длиной до часа, а если включены разметка говорящих или метки времени — до 30 минут. В потоковом режиме говорящих модель не различает и метки времени не ставит. Надёжно она размечает до трёх говорящих, а для большего числа Google называет эту функцию экспериментальной. Компания также предупреждает, что пословные метки времени снижают точность расшифровки, а список терминов нельзя включить вместе с ними и с разметкой говорящих.
Источники: Анонс Gemini 3.5 Transcribe, Документация Gemini API
Новости о модели
- 01
- 02
- 03
- 04
- 05
- 06
Данные: models.dev (MIT).