Модель · NVIDIA
Nemotron 3 Diarization
Открытая модель NVIDIA на 100 млн параметров: размечает, кто и когда говорил, до восьми голосов в записи и в живом разговоре
вышла 23 сентября
Характеристики
- Вышла
- 23 сентября
- Понимает
- аудио
- Отвечает
- текст
- РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
- —
- Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
- —
- ВесаОткрытые — файлы модели выложены в свободный доступ, и запускать и дообучать её могут не только авторы. Небольшие модели работают на обычном компьютере. Большим нужны серверы с дорогими видеокартами: такие модели разворачивают компании и облачные сервисы, а остальные пользуются ими через них. Закрытые — доступ только через сервис лаборатории
- открытые
- Идентификатор в API
- nemotron-3-diarization
Что это за модель
Nemotron 3 Diarization решает задачу диаризации, то есть размечает аудиозапись по говорящим. Слов она не распознаёт. Она отвечает на вопрос «кто и когда говорил»: отмечает отрезки речи и даёт им условные метки вроде «говорящий 1» и «говорящий 2». Внутри у неё трансформер из 31 слоя, всего около 100 млн параметров, а основой послужила более ранняя разработка NVIDIA Streaming Sortformer. Обычно такую разметку делают в несколько этапов: режут речь на куски и сравнивают «отпечатки» голосов. Эта модель обходится одним проходом и нумерует говорящих в том порядке, в каком они впервые звучат в записи.
Её предшественница, Streaming Sortformer, различала четыре голоса, новая модель — восемь, и ошибается она реже. Точность здесь меряют долей ошибок диаризации (DER): в неё входят пропущенная речь, ложные срабатывания и перепутанные говорящие. По замерам NVIDIA, при задержке около секунды эта доля снизилась в среднем на 40%, а на наборе DIHARD III упала с 19,09% до 12,73%. В открытом рейтинге Diarization-Bench площадки VoiceArena модель заняла первое место среди 12 систем с долей ошибок 14,72%. У следующей системы в рейтинге этот показатель 19,3%. Для обучения взяли около 10 тыс. часов настоящих разговоров и больше 80 тыс. часов искусственно смешанных записей на 21 языке.
Модель берут, чтобы получить расшифровку, где указано, кто что сказал. Сама она выдаёт только разметку по времени, а текст пишет отдельная модель распознавания речи. NVIDIA выложила руководство, как соединить их вместе. Лаборатория называет такие сценарии: протоколы встреч в реальном времени, подкасты и эфиры, анализ звонков в колл-центрах. Задержку можно настроить: от 0,32 секунды для живого разговора до режима с запасом в 30,4 секунды для готовых записей, где точность выше. Размечает она и перекрывающуюся речь, когда люди говорят одновременно.
NVIDIA сама перечисляет ограничения. Больше восьми говорящих модель не различает: лишних она пропустит или спутает с другими. Качество падает при сильном шуме и эхе, при записи с дальнего микрофона и на аудио, которое не похоже на обучающее. Метки условные: кто именно говорит, модель не определяет. Работать она рассчитана под Linux на видеокартах NVIDIA, основные замеры сделаны на английской речи, а веса выложены под лицензией OpenMDW 1.1, которая разрешает коммерческое использование.
Источники: Анонс NVIDIA в блоге на Hugging Face, Карточка модели на Hugging Face
Новости о модели
- 01
- 02
- 03
- 04
Данные: models.dev (MIT).