ИИтак

← Назад

NVIDIA выпустила модель, которая различает до восьми голосов в разговоре

Модель Nemotron 3 Diarization на 100 млн параметров возглавила предварительный рейтинг Voice Arena: 14,72% ошибок разметки против 19,3% у ближайшего конкурента. Веса модели открыты.

NVIDIA выложила с открытыми весами1 модель Nemotron 3 Diarization, которая по записи разговора отмечает, кто и в какие секунды говорил, сообщила компания в блоге на Hugging Face. Модель различает до восьми собеседников и замечает, когда люди перебивают друг друга. Она работает и с готовыми записями, и с потоком звука в реальном времени.

Такую разметку называют диаризацией. Распознавание речи превращает звук в текст, но не сообщает, чья это реплика. Без меток говорящих по расшифровке совещания не понять, кто пообещал взять задачу, а кто возразил.

Имён людей модель не определяет. Она выдаёт анонимные метки вроде speaker_2, а сопоставлять их с участниками должно приложение — например, по данным о встрече или профилям пользователей.

В предварительных результатах бенчмарка2 Diarization-Bench от Voice Arena3 модель заняла первое место среди 12 систем. Их проверяли на 139 англоязычных разговорах общей длительностью около 22 часов. Доля ошибок у Nemotron 3 Diarization составила 14,72%, у второй в рейтинге системы — 19,3%.

В этот показатель входят пропущенная речь, ложные срабатывания и реплики, приписанные не тому человеку. NVIDIA предупреждает, что результаты могут измениться, когда Voice Arena завершит оценку и статистический анализ.

Предшественница модели — Streaming Sortformer v2.1, которая различала до четырёх голосов. Обе модели работают в нескольких режимах, которые различаются задержкой — тем, сколько секунд звука модель копит, прежде чем выдать разметку. Чем больше запас, тем, как правило, точнее результат, но тем позже он появляется.

В режиме с задержкой около секунды у Nemotron 3 Diarization доля ошибок ниже на всех восьми наборах данных, где её проверяла NVIDIA: в среднем на 41%, в зависимости от набора — на 9–65%. Исключение нашлось в другом режиме — для готовых записей, когда модель копит 30,4 секунды звука, — и лишь на части одного набора. На телефонных разговорах двух человек из CALLHOME доля ошибок выросла с 5,68% до 5,98%, хотя по всему набору она снизилась.

На видеокарте RTX PRO 5000 при пакетной обработке записей новая модель обрабатывает звук примерно в 15 тыс. раз быстрее реального времени, предшественница — в 2,6 тыс. раз. Минимальная рекомендуемая задержка — 0,32 секунды: столько звука модель копит перед обработкой, время вычислений сюда не входит.

Компания Argmax, которая делает инструменты для запуска моделей прямо на телефонах и компьютерах, встроила Nemotron 3 Diarization в свой набор для разработчиков Argmax Pro SDK 3. Argmax также сама сравнила шесть систем разметки говорящих на 11 наборах данных, и самая низкая доля ошибок оказалась у модели NVIDIA.

«Это огромный скачок в точности по сравнению с предшественницей Sortformer v2.1, у которой доля ошибок была на 60% выше», — отметил глава Argmax Атила Орхон.

Модель принимает звук с частотой 16 кГц в моно и рассчитана на Linux с видеокартами NVIDIA поколений Ampere, Hopper и Blackwell. Если собеседников больше восьми, часть речи она может пропустить или приписать не тому говорящему. Распространяется модель по лицензии OpenMDW 1.14.

← Все новости