ИИтак

← Назад

NVIDIA почти вдвое снизила ошибки распознавания двух саудовских диалектов

Примерно за 4,5 часа обучения на двух видеокартах открытая модель NVIDIA стала почти вдвое реже ошибаться в двух саудовских диалектах, не разучившись распознавать английскую речь.

Схема дообучения саудовского ASR Изображение: NVIDIA

NVIDIA дообучила модель распознавания речи Nemotron 3.5 ASR на 134 часах саудовских записей. На недждийском и хиджазском диалектах доля неверно распознанных слов упала с 55% до 30%. Это открытая модель на 600 млн параметров: она вышла в июне и расшифровывает речь прямо по ходу разговора на 40 языках, если считать региональные варианты отдельно.

модель, обученная на десятках языков, может хорошо понимать литературный арабский и английский и при этом путаться в местной речи. Если дообучать её на одном диалекте, можно испортить остальные языки. NVIDIA показала, как подтянуть диалект и сохранить прежние навыки.

первая попытка учить модель сразу 11 диалектам саудовского набора SADA1 упёрлась в потолок: ошибки на проверочных записях снизились лишь с 49,5% до 46,7%. Сработали три изменения:

  • Модель учили только двум диалектам, на которых ей предстоит работать: недждийскому из центра страны и хиджазскому с запада.
  • К саудовским записям подмешали 10% записей из набора FLEURS2: 7% английских и 3% арабских. Это нужно, чтобы модель не забывала прежнюю работу, пока учит новую.
  • Записи собирали в пакеты по длительности, чтобы короткие фразы не дополнялись пустотой до длины длинных и вычисления не уходили впустую.

стандартный фильтр качества звука UTMOS с порогом 3,0 отбросил бы почти весь саудовский корпус. Поэтому данные чистили бережно: убирали записи с пометкой «неразборчиво» вместо расшифровки и те, где текст явно не совпадает со звуком. Трудные акценты и шумную речь оставляли. В итоге сохранилось 103 559 фраз из 125 490, или 133,7 часа.

вот что дали 12 000 шагов обучения на двух видеокартах RTX PRO 6000 Blackwell:

  • На тестовой части недждийской и хиджазской речи доля ошибочных слов снизилась с 55,05% до 29,96%.
  • По всем диалектам набора SADA, включая те, что в обучение не вошли, ошибок стало на 23 процентных пункта меньше.
  • На английских записях FLEURS доля ошибок не выросла, а немного снизилась: с 11,04% до 10,42%.

авторы проверили, что ещё влияет на точность:

  • Обновлять стоит все 24 слоя кодировщика — части модели, которая разбирает звук: если менять только верхние восемь, ошибок на 2,4 пункта больше.
  • Если разрешить модели заглядывать на 13 кадров звука вперёд вместо трёх, ошибок становится на 1,31 пункта меньше, но ответ запаздывает примерно на 800 мс.
  • Лучевой поиск, при котором модель держит восемь вариантов расшифровки и выбирает лучший, без переобучения снизил долю ошибок с 29,96% до 28,62%.

задержка в 800 мс подходит для расшифровки архивов звонков и записей встреч, а для живых субтитров может не годиться. Авторы предупреждают, что подмешанные записи из FLEURS защищают только те навыки, которые в них представлены. Кроме того, результат не доказывает, что рецепт сработает на любом арабском диалекте.

на GitHub выложены интерактивный блокнот с кодом рецепта, который запускают по шагам, и навык — инструкция, по которой ИИ-агент проводит пользователя через рецепт. Для других языков NVIDIA советует начинать с небольшого проверенного набора записей. Там, где слова не разделяются пробелами, компания предлагает считать ошибки по символам, а не по словам.

Расшифровку можно дополнить разметкой, кто из собеседников говорит. Для этого компания предлагает свою модель Nemotron 3 Diarization, она различает до восьми голосов.

NVIDIA выпустила открытую модель, которая определяет, кто и когда говорил

← Все новости