ИИтак

← Назад

модель · Microsoft · вышла 1 октября

MAI-Transcribe-2-Streaming

Предварительная версия модели Microsoft для расшифровки речи на лету на 60 языках: текст появляется, пока человек ещё говорит

О модели

MAI-Transcribe-2-Streaming — модель Microsoft AI, которая переводит живую речь в текст прямо во время разговора. Это первая потоковая модель расшифровки у лаборатории: звук идёт на сервер непрерывным потоком, а текст приходит обратно кусками, и конца фразы ждать не нужно. Сначала модель выдаёт черновой вариант, так называемую промежуточную расшифровку. Пока поступает новый звук, она его уточняет, а потом закрепляет окончательный текст каждого отрезка. По словам компании, первый черновик появляется через сто с небольшим миллисекунд после того, как модель получила звук.

От MAI-Transcribe-2, которую Microsoft выпустила в начале сентября, она отличается режимом работы: та расшифровывает готовые записи, а эта — звук в реальном времени. Языков у неё тоже 60, русский в их числе. Язык модель определяет сама и следит за ним весь разговор. Microsoft заявляет, что модель заняла первое место в рейтинге Artificial Analysis по точности и окончательной, и промежуточной расшифровки. По словам компании, слова в тексте у неё появляются вдвое быстрее, чем у ближайшего конкурента.

Microsoft называет такие сценарии: колл-центры, голосовые помощники, субтитры на встречах и лекциях, голосовое управление и заметки по ходу разговора. Модель вышла вместе с синтезаторами речи MAI-Voice-2.1 и MAI-Voice-2.1-Flash. Вместе из них можно собрать голосового агента: он слышит запрос клиента, берётся за дело ещё до того, как тот договорил, и отвечает голосом. Подключиться можно по протоколу, похожему на OpenAI Realtime, или через библиотеку Azure Speech SDK. Модель доступна в Microsoft Foundry, а также через Vercel и OpenRouter.

Сейчас это публичная предварительная версия без гарантий доступности, и Microsoft не советует ставить её в рабочую среду. Один сеанс длится не больше часа. Паузы в речи сервер сам не распознаёт: когда закрыть фразу и получить окончательный текст, решает приложение, отправляя отдельную команду. Звук нужно передавать без сжатия, в одном канале, с частотой 16 или 24 кГц.

Данные: models.dev (MIT).