NVIDIA почти вдвое снизила ошибки распознавания двух саудовских диалектов
Примерно за 4,5 часа обучения на двух видеокартах открытая модель NVIDIA стала почти вдвое реже ошибаться в двух саудовских диалектах, не разучившись распознавать английскую речь.

NVIDIA дообучила модель распознавания речи Nemotron 3.5 ASR на 134 часах саудовских записей. На недждийском и хиджазском диалектах доля неверно распознанных слов упала с 55% до 30%. Это открытая модель на 600 млн параметров: она вышла в июне и расшифровывает речь прямо по ходу разговора на 40 языках, если считать региональные варианты отдельно.
Почему это важно: модель, обученная на десятках языков, может хорошо понимать литературный арабский и английский и при этом путаться в местной речи. Если дообучать её на одном диалекте, можно испортить остальные языки. NVIDIA показала, как подтянуть диалект и сохранить прежние навыки.
Как это работает: первая попытка учить модель сразу 11 диалектам саудовского набора SADA1 упёрлась в потолок: ошибки на проверочных записях снизились лишь с 49,5% до 46,7%. Сработали три изменения:
- Модель учили только двум диалектам, на которых ей предстоит работать: недждийскому из центра страны и хиджазскому с запада.
- К саудовским записям подмешали 10% записей из набора FLEURS2: 7% английских и 3% арабских. Это нужно, чтобы модель не забывала прежнюю работу, пока учит новую.
- Записи собирали в пакеты по длительности, чтобы короткие фразы не дополнялись пустотой до длины длинных и вычисления не уходили впустую.
Интрига: стандартный фильтр качества звука UTMOS с порогом 3,0 отбросил бы почти весь саудовский корпус. Поэтому данные чистили бережно: убирали записи с пометкой «неразборчиво» вместо расшифровки и те, где текст явно не совпадает со звуком. Трудные акценты и шумную речь оставляли. В итоге сохранилось 103 559 фраз из 125 490, или 133,7 часа.
В цифрах: вот что дали 12 000 шагов обучения на двух видеокартах RTX PRO 6000 Blackwell:
- На тестовой части недждийской и хиджазской речи доля ошибочных слов снизилась с 55,05% до 29,96%.
- По всем диалектам набора SADA, включая те, что в обучение не вошли, ошибок стало на 23 процентных пункта меньше.
- На английских записях FLEURS доля ошибок не выросла, а немного снизилась: с 11,04% до 10,42%.
Детали: авторы проверили, что ещё влияет на точность:
- Обновлять стоит все 24 слоя кодировщика — части модели, которая разбирает звук: если менять только верхние восемь, ошибок на 2,4 пункта больше.
- Если разрешить модели заглядывать на 13 кадров звука вперёд вместо трёх, ошибок становится на 1,31 пункта меньше, но ответ запаздывает примерно на 800 мс.
- Лучевой поиск, при котором модель держит восемь вариантов расшифровки и выбирает лучший, без переобучения снизил долю ошибок с 29,96% до 28,62%.
Но: задержка в 800 мс подходит для расшифровки архивов звонков и записей встреч, а для живых субтитров может не годиться. Авторы предупреждают, что подмешанные записи из FLEURS защищают только те навыки, которые в них представлены. Кроме того, результат не доказывает, что рецепт сработает на любом арабском диалекте.
Что дальше: на GitHub выложены интерактивный блокнот с кодом рецепта, который запускают по шагам, и навык — инструкция, по которой ИИ-агент проводит пользователя через рецепт. Для других языков NVIDIA советует начинать с небольшого проверенного набора записей. Там, где слова не разделяются пробелами, компания предлагает считать ошибки по символам, а не по словам.
Расшифровку можно дополнить разметкой, кто из собеседников говорит. Для этого компания предлагает свою модель Nemotron 3 Diarization, она различает до восьми голосов.
Подробнее: NVIDIA выпустила открытую модель, которая определяет, кто и когда говорил