ИИтак

← Назад

Модель · Google

Gemini 3.5 Transcribe

Модель Google для расшифровки речи в текст, из файлов и в реальном времени; пока предварительная версия

вышла 26 августа

Характеристики

Вышла
26 августа
Понимает
аудио
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Идентификатор в API
gemini-3.5-transcribe

Что это за модель

Gemini 3.5 Transcribe — модель Google для распознавания речи: она принимает звук и возвращает текст. Google называет её своей самой точной моделью для перевода речи в текст. Модель не просто записывает сказанное дословно, а выдаёт аккуратный отформатированный текст. Она убирает слова-паразиты и учитывает, когда человек поправляет сам себя. Есть два варианта: gemini-3.5-transcribe расшифровывает готовые аудиофайлы, а gemini-3.5-transcribe-live работает с потоком через Live API. Во втором случае текст приходит по кусочкам прямо во время разговора.

Google сравнивает модель с прошлой системой распознавания Chirp 3. По замерам компании, новая модель ошибается реже и в потоковом режиме, и при работе с файлами. Кроме того, финальная расшифровка, по данным Google, появляется на 70% быстрее. Модель сама определяет язык, всего их больше 85. Она справляется с акцентами и диалектами, а также с речью, где собеседники переходят с языка на язык посреди фразы.

Модель подходит для голосовых интерфейсов, диктовки, расшифровки встреч и звонков. Ей можно передать список до 1000 специальных терминов и необычных написаний, чтобы она распознавала их правильно. При работе с файлами она различает говорящих, то есть размечает, кто какую реплику произнёс, и ставит метки времени к каждому слову. Ещё модель умеет вызывать функции и передавать задачи другим моделям Gemini. Google встроила её в приложение Gemini для macOS, а разработчикам она доступна через Gemini API и Google AI Studio.

Модель вышла как предварительная версия. Потоковая сессия длится не дольше 10 минут. Файл можно загрузить длиной до часа, а если включены разметка говорящих или метки времени — до 30 минут. В потоковом режиме говорящих модель не различает и метки времени не ставит. Надёжно она размечает до трёх говорящих, а для большего числа Google называет эту функцию экспериментальной. Компания также предупреждает, что пословные метки времени снижают точность расшифровки, а список терминов нельзя включить вместе с ними и с разметкой говорящих.

Источники: Анонс Gemini 3.5 Transcribe, Документация Gemini API

Новости о модели

  1. 01

    Alibaba выпустила Qwen3.8-Omni-Flash — модель, которая смотрит видео, слушает звук и работает с инструментами

    Qwen · X

  2. 02

    Google выпустила голосовые модели Gemini 3.8 Live: агент работает, не прерывая разговор

    Google для разработчиков

  3. 03

    Google подвела итоги работы над языками: 300 языков, офлайн-перевод и Gemini на кнопочных телефонах

    Google AI

  4. 04

    Cohere выпустила открытую модель-переводчик North Small Translate: по её тестам она обходит DeepL и Google

    Cohere

  5. 05

    Приложением Gemini пользуются больше миллиарда человек в месяц: итоги августа у Google

    Google AI

  6. 06

    Gemini научилась сама выбирать, какие фрагменты видео смотреть, и тратит до 88% меньше токенов

    Google DeepMind

все 8 новостей о Gemini 3.5 →

Данные: models.dev (MIT).