ИИтак

← Назад

Модели распознавания речи узнают бенчмарк по звуку и пишут «ожидаемый» ответ

Авторы Open ASR Leaderboard проверили 11 открытых моделей распознавания речи. Лучшие по оценкам модели повторяют ошибки эталонных расшифровок VoxPopuli и LibriSpeech и даже «слышат» числа, вырезанные из записи.

Изображение: Hugging Face

Самые высокие оценки на популярных тестах распознавания речи отчасти получены за счёт подгонки. Модели угадывают, из какого набора данных запись, и пишут то, что ждёт тест, а не то, что звучит. К такому выводу пришли авторы рейтинга Open ASR Leaderboard, опубликовавшие исследование в блоге Hugging Face. Они проверили 11 популярных открытых моделей на наборах VoxPopuli и LibriSpeech.

Первый тест опирается на ошибки в самих эталонах. В VoxPopuli, записях выступлений в Европарламенте, их известно много. В одном фрагменте спикер отчётливо говорит «Thank you, Mr. President», а в эталонной расшифровке нет слов «Thank you». Шесть моделей из 11 повторили эту ошибку. Когда ту же фразу озвучили нейтральным синтезированным голосом, все одиннадцать услышали благодарность. Всего метод нашёл возможные ошибки эталона в 40% проверенных фрагментов, это около 3% всех слов. Подогнанные модели воспроизводили такие ошибки в 18–30% случаев. Чаще всего это делали модели с лучшим показателем WER, то есть лидеры рейтингов.

Во втором тесте из записей вырезали числа, так что в звуке их просто не было. На LibriSpeech некоторые сильные модели всё равно вписывали точное число из эталона в 30–40% примеров. Одна модель «восстановила» заглушённый 2011 год. Третий тест проверял написание: VoxPopuli сокращает «Mr.», LibriSpeech пишет «Mister», хотя звучат они одинаково. Случайный выбор дал бы совпадение в 50% случаев, а у некоторых моделей оно доходит примерно до 90%.

Подгонку выдаёт акустический контекст. На свежих записях из тех же источников, сделанных после окончания обучения моделей, многие переходят к честной расшифровке. Тот же эффект дают обрезка окружающего звука из бенчмарка или добавленный к записи обычный разговор. А если приклеить к записи кусок VoxPopuli, модель чаще выдаёт эталонный ответ. По мнению авторов, модели умеют расшифровать сказанное дословно, но по звуку решают, следовать ли аудио или привычкам конкретного теста.

В Open ASR Leaderboard появилась вкладка «Benchmark fitting» с двумя из этих проверок для всех моделей. Скрипты и сырые ответы моделей выложены в открытый доступ. Тем, кто выбирает модель, авторы советуют смотреть на закрытые тестовые наборы, а не на WER одного публичного бенчмарка. Составителям тестов они предлагают делить данные по времени записи или по дикторам, а не случайным образом.

← Все новости