В рейтинге распознавания речи появились хинди и индийский английский, а с ними — данные о каждом дикторе
Hugging Face и Voice Arena добавили в Open ASR Leaderboard наборы Monsoon: почти 4 900 дикторов из сотен индийских районов, для каждого записано 12 характеристик. Хинди — первый язык из Индии в многоязычном разделе рейтинга.

В открытом рейтинге систем распознавания речи Open ASR Leaderboard появились хинди и индийский английский. Hugging Face добавила их вместе с платформой Voice Arena. До сих пор многоязычный раздел рейтинга состоял только из европейских языков. Хинди, на котором говорят больше полумиллиарда человек, стал первым языком Индии в этом списке.
Новые наборы называются Monsoon. На каждый язык приходится открытая часть, которую разработчики могут проверять сами, и закрытая. Закрытую держат в секрете, чтобы модели не подгоняли именно под этот тест. Всего в наборах 4 888 дикторов, и ни один из них не попадает в две части сразу. О каждом дикторе записано 12 характеристик: возраст, пол, район, профессия, образование, модель телефона и другие. Обычно в тестовых наборах есть только расшифровка и длительность записи.
Записи собирали так, чтобы результат не зависел от нескольких голосов. Люди говорили на бытовые темы в свободном разговоре со своих телефонов, дома и на улице, часто при плохой связи. Англоязычная часть охватывает 428 районов в 30 штатах и союзных территориях. Больше половины дикторов звучат ровно в одном фрагменте. Телефоны — от 315 до 582 разных моделей, и ни одна не даёт больше 2,1% фрагментов. Эталонные расшифровки люди выверяли в пять кругов, и ни один лингвист не проверял собственную работу.
Авторы показали, зачем всё это нужно. Восемь моделей на индийском английском показали WER от 4,81 до 4,99% — по общему баллу они неразличимы. Если разбить дикторов по регионам, картина другая. У whisper-large-v3-turbo от OpenAI разброс между регионами — 0,46 пункта. У Voxtral-Mini-3B от Mistral — 1,68: 4,38% ошибок в центре страны и 6,06% на востоке. Самый трудный регион у каждой модели свой. Значит, дело в моделях, а не в записях.
С хинди есть отдельная сложность: одно и то же слово можно правильно записать по-разному, особенно английские заимствования. Если сравнивать ответ модели с одной эталонной расшифровкой, модель получает баллы за то, что угадала написание, выбранное разметчиком. Поэтому для хинди лингвисты составили списки допустимых написаний для каждого фрагмента, а оценку считают по метрике OIWER. При проверке по одному эталону ошибок у всех систем становится больше, и некоторые пары моделей меняются местами. Код подсчёта выложен в открытый доступ.
Индийский английский вошёл в основную таблицу и теперь влияет на средний балл каждой модели. Хинди — в многоязычном разделе. Недавно команда рейтинга уже показала, что модели распознавания речи порой воспроизводят эталонные расшифровки вместо того, что звучит в записи. Monsoon — продолжение этой работы: авторы признают, что наборы не устраняют перекосы, а лишь делают их видимыми.