ИИтак

← Назад

Модель · NVIDIA

Nemotron 3 Diarization

Открытая модель NVIDIA на 100 млн параметров: размечает, кто и когда говорил, до восьми голосов в записи и в живом разговоре

вышла 23 сентября

Характеристики

Вышла
23 сентября
Понимает
аудио
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
—
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
—
ВесаОткрытые — файлы модели выложены в свободный доступ, и запускать и дообучать её могут не только авторы. Небольшие модели работают на обычном компьютере. Большим нужны серверы с дорогими видеокартами: такие модели разворачивают компании и облачные сервисы, а остальные пользуются ими через них. Закрытые — доступ только через сервис лаборатории
открытые
Идентификатор в API
nemotron-3-diarization

Что это за модель

Nemotron 3 Diarization решает задачу диаризации, то есть размечает аудиозапись по говорящим. Слов она не распознаёт. Она отвечает на вопрос «кто и когда говорил»: отмечает отрезки речи и даёт им условные метки вроде «говорящий 1» и «говорящий 2». Внутри у неё трансформер из 31 слоя, всего около 100 млн параметров, а основой послужила более ранняя разработка NVIDIA Streaming Sortformer. Обычно такую разметку делают в несколько этапов: режут речь на куски и сравнивают «отпечатки» голосов. Эта модель обходится одним проходом и нумерует говорящих в том порядке, в каком они впервые звучат в записи.

Её предшественница, Streaming Sortformer, различала четыре голоса, новая модель — восемь, и ошибается она реже. Точность здесь меряют долей ошибок диаризации (DER): в неё входят пропущенная речь, ложные срабатывания и перепутанные говорящие. По замерам NVIDIA, при задержке около секунды эта доля снизилась в среднем на 40%, а на наборе DIHARD III упала с 19,09% до 12,73%. В открытом рейтинге Diarization-Bench площадки VoiceArena модель заняла первое место среди 12 систем с долей ошибок 14,72%. У следующей системы в рейтинге этот показатель 19,3%. Для обучения взяли около 10 тыс. часов настоящих разговоров и больше 80 тыс. часов искусственно смешанных записей на 21 языке.

Модель берут, чтобы получить расшифровку, где указано, кто что сказал. Сама она выдаёт только разметку по времени, а текст пишет отдельная модель распознавания речи. NVIDIA выложила руководство, как соединить их вместе. Лаборатория называет такие сценарии: протоколы встреч в реальном времени, подкасты и эфиры, анализ звонков в колл-центрах. Задержку можно настроить: от 0,32 секунды для живого разговора до режима с запасом в 30,4 секунды для готовых записей, где точность выше. Размечает она и перекрывающуюся речь, когда люди говорят одновременно.

NVIDIA сама перечисляет ограничения. Больше восьми говорящих модель не различает: лишних она пропустит или спутает с другими. Качество падает при сильном шуме и эхе, при записи с дальнего микрофона и на аудио, которое не похоже на обучающее. Метки условные: кто именно говорит, модель не определяет. Работать она рассчитана под Linux на видеокартах NVIDIA, основные замеры сделаны на английской речи, а веса выложены под лицензией OpenMDW 1.1, которая разрешает коммерческое использование.

Источники: Анонс NVIDIA в блоге на Hugging Face, Карточка модели на Hugging Face

Новости о модели

  1. 01

    NVIDIA выпустила открытую модель, которая определяет, кто и когда говорил

    Hugging Face

  2. 02

    NVIDIA: NIM обслуживает до 2,5 раза больше пользователей Nemotron 3 Ultra

    NVIDIA для разработчиков

  3. 03

    NVIDIA сжала Nemotron 3.5 Lightning до 22 ГБ почти без потери точности

    NVIDIA для разработчиков

  4. 04

    NVIDIA выпустила Nemotron 3.5 Lightning — малую открытую модель для агентов

    NVIDIA для разработчиков

все упоминания Nemotron 3 — 18 →

Данные: models.dev (MIT).