ИИтак

← Назад

Модель · Microsoft

VibeVoice-ASR-Streaming

Открытая модель Microsoft для распознавания речи на лету с пометками, кто говорит; старшая из двух версий

вышла 2 сентября

Характеристики

Вышла
2 сентября
Понимает
аудио
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
нет
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
нет
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
vibevoice-asr-streaming-7b

Что это за модель

VibeVoice-ASR-Streaming — модель Microsoft Research для распознавания речи в потоке. Она переводит звук в текст по мере того, как человек говорит, и сразу отмечает, какой из собеседников произнёс каждую фразу. В основе лежит большая языковая модель. На вход она получает три вещи вперемешку: кусок звука фиксированной длины, короткий фрагмент звука «с запасом вперёд» и уже расшифрованный текст. Версия 7B — старшая. Вместе с ней вышла более лёгкая версия на 1,5 млрд параметров.

Обычно распознавание речи и диаризация, то есть разметка «кто говорит», работают как два отдельных этапа. Здесь обе задачи решает одна модель, и отдельный этап диаризации не нужен. Microsoft называет свою разработку одним из первых сквозных подходов такого рода на основе языковой модели для потоковой работы. По словам авторов, прежние модели, которые объединяли обе задачи, в основном обрабатывали уже готовую запись целиком. Так была устроена и предыдущая VibeVoice-ASR из той же линейки.

Модель рассчитана на голосовых помощников и агентов, которым нужна расшифровка с низкой задержкой: созвоны, встречи, живые разговоры. Ей можно заранее передать список ключевых слов, например имена или профессиональные термины, чтобы она точнее их распознавала. Модель поддерживает 10 языков, в том числе русский, английский, китайский и японский. По замерам лаборатории, у версии 7B самая низкая средняя доля ошибок распознавания (показатели WER и CER) на пяти тестовых наборах. В разметке говорящих она лучшая или делит первое место в 12 из 13 тестовых условий.

Языков всего десять, на остальных качество не гарантируется. Задержку в цифрах лаборатория в описании модели не приводит. Для работы старшей версии нужна мощная видеокарта. Кому важнее скорость и скромное железо, могут взять версию 1.5B. Веса и код для запуска распространяются по лицензии MIT, которая разрешает и коммерческое использование.

Источники: Карточка модели на Hugging Face, Технический отчёт, Код VibeVoice на GitHub

Новости о модели

  1. 01

    Microsoft открыла потоковую модель распознавания речи VibeVoice, которая различает говорящих

    Microsoft · HF

все 1 новость о VibeVoice-ASR-Streaming →

Данные: models.dev (MIT).