Microsoft открыла потоковую модель распознавания речи VibeVoice, которая различает говорящих
Microsoft Research выложила на Hugging Face две версии VibeVoice-ASR-Streaming — 7B и 1.5B. Модель расшифровывает речь на лету, отмечает, кто говорит, и понимает 10 языков, включая русский. Лицензия MIT.
Microsoft Research выложила в открытый доступ VibeVoice-ASR-Streaming — модель, которая превращает речь в текст прямо по ходу разговора. При этом она сразу помечает, какую реплику произнёс какой собеседник. Вышло две версии: крупная 7B и облегчённая 1.5B. Цифры в названии обозначают примерное число параметров в миллиардах.
Обычно такую работу делят на два шага: одна система расшифровывает запись, а другая потом разбирается, кто где говорил. Здесь оба шага объединены в одной модели, и работает она потоково: текст с именами говорящих появляется, пока звук ещё идёт. Для созвонов, интервью и субтитров в прямом эфире это удобнее, чем ждать конца записи.
Ещё одна возможность — пользовательский словарь ключевых слов. Модели можно заранее передать имена, названия и профессиональные термины, чтобы она не коверкала их при распознавании. Среди поддерживаемых языков — английский, китайский, русский, японский, корейский и пять европейских.
Модель распространяется под лицензией MIT, которая разрешает и коммерческое использование. Код и инструкции по запуску лежат на GitHub в репозитории VibeVoice, есть и онлайн-демо. Результаты тестов разработчики вынесли в технический отчёт, а в карточке модели цифр точности и задержки нет. Так что насколько она хороша в сравнении с конкурентами, пока можно судить только по словам авторов.