Google выпустила Gemini 3.5 Transcribe — модель, которая превращает речь в чистый текст
Gemini 3.5 Transcribe убирает «эээ», учитывает оговорки и понимает более 85 языков. Разработчикам модель доступна в предварительной версии через Gemini API, а обычным пользователям — в Gemini для macOS и функции Rambler на Android.

Google DeepMind представила Gemini 3.5 Transcribe — модель, которая переводит речь в текст. Её главное отличие от обычной диктовки в том, что на выходе получается не стенограмма, а готовый текст. Модель выкидывает слова-паразиты, сама расставляет форматирование и понимает оговорки: из фразы «встретимся во вторник — нет, в среду» останется только среда.
Разработчикам модель доступна в двух вариантах. Потоковая версия работает через Live API с задержкой меньше секунды и подходит для голосовых ассистентов и живых субтитров. Вторая версия расшифровывает готовые записи — встречи, звонки. Она различает, кто говорит, и ставит метку времени у каждого слова. Надёжно модель различает до трёх собеседников, если их больше, эта функция пока экспериментальная. Ещё модель автоматически определяет язык, а их поддерживается более 85. Ей можно передать собственный словарь с отраслевыми терминами и необычными написаниями.
По замерам Artificial Analysis WER составил 4% в потоковом режиме и 2,6% при расшифровке записей. Google сравнивает модель с предыдущей, Chirp 3: итоговая расшифровка теперь появляется на 70% быстрее. На многоязычном бенчмарке FLEURS модель ошибается в 5,5% слов в потоковом режиме и в 5,04% — при обработке записей.
Модель уже работает в продуктах Google. На Android в клавиатуре Gboard появилась функция Rambler: она превращает сбивчивую речь в аккуратный текст, а голосом можно исправлять опечатки и менять стиль. В приложении Gemini для macOS модель понимает голосовые команды и передаёт тяжёлую работу другим моделям Gemini: краткий пересказ файла, генерацию картинки у курсора, анализ документа. В среде разработки Antigravity модель с разрешения пользователя учитывает содержимое экрана и историю чата, чтобы правильно распознавать названия файлов. Скоро голосовой ввод появится в Chrome для любого текстового поля.
Для разработчиков модель открыта в предварительной версии через Gemini API в Google AI Studio и Antigravity, для компаний — через Gemini Enterprise Agent Platform. В приложении Gemini для macOS она пока работает только на английском, а Rambler доступен лишь в некоторых странах и на некоторых языках.