ИИтак

← Назад

В Amazon научились учитывать, что ИИ-судьи ошибаются хором

Исследователи Amazon предложили способ сводить оценки нескольких ИИ-судей с учётом того, насколько похоже они ошибаются. На трёх задачах точность выросла на 9–14% по сравнению со взвешенным голосованием.

Исследователи Amazon предложили, как правильно сводить вердикты нескольких языковых моделей, которые оценивают ответы других ИИ-систем. Главная мысль такая: если судьи похожи друг на друга, их согласие стоит меньше, чем кажется. Работу, написанную в соавторстве с Shiva Kasiviswanathan, представили на конференции ICML в этом году, а 26 августа авторы подробно рассказали о ней в блоге Amazon Science.

Подход «LLM-as-a-judge» стал стандартным способом проверять ИИ-системы без участия людей. Например, одна модель решает, подходит ли найденный фрагмент текста к вопросу пользователя. Чтобы оценка была надёжнее, спрашивают сразу несколько моделей. Допустим, восемь из десяти сказали «подходит» — звучит убедительно. Но если у этих восьми общий шаблон запроса, одно семейство или похожие данные для обучения, они вполне могут повторять одну и ту же ошибку. Простое голосование этого не замечает. Взвешенное, где у исторически более точных судей больше голоса, тоже не замечает: оба метода исходят из того, что каждый судья ошибается сам по себе.

Авторы смотрят на группу судей как на сеть. У каждого судьи есть своя надёжность, а у каждой пары — степень сходства. Некоторые пары совпадают чаще, чем можно ожидать от их индивидуальной точности, в том числе в ошибках. Эти связи описываются моделью Изинга. Важная деталь: метод обходится без человеческой разметки. Истинный ответ для каждого примера считается скрытой величиной. Алгоритм по очереди уточняет вероятность правильного ответа и заново оценивает надёжность судей и связи между ними. Эталонные метки понадобились только для того, чтобы потом измерить точность.

Метод существует в двух вариантах. В простом структура связей одинакова для положительных и отрицательных ответов. Итог по-прежнему похож на взвешенное голосование, только лишнее согласие похожих судей учитывается с меньшим весом, и результат легко интерпретировать. В сложном варианте связи зависят от ответа. Это помогает, когда судьи единодушны в очевидных случаях и раскалываются на узнаваемые группы в спорных. Зато такому варианту нужно больше данных.

Проверяли метод на трёх задачах с двумя вариантами ответа: соответствие найденного текста вопросу, обнаружение токсичности и оценка качества пересказа. Судей было десять, все работали при нулевой температуре, то есть на одинаковый вход всегда давали одинаковый ответ. С полным набором данных точность в задаче на соответствие составила 0,912 против 0,820 у взвешенного голосования и 0,804 у простого. На токсичности — 0,792 против 0,694 и 0,695, на пересказах — 0,806 против 0,737 и 0,561. Выигрыш появлялся, когда было достаточно примеров и судей, чтобы надёжно оценить связи между ними.

Командам, которые уже собирают оценки ИИ-судей в больших масштабах, авторы советуют проверять группу судей целиком, а не каждого по отдельности. Разнообразие моделей, по их мнению, полезно лишь тогда, когда разные модели действительно ошибаются по-разному. Ещё они советуют смотреть, на какие группы разбиваются судьи, и сообщать уверенность с поправкой на их сходство: десять похожих голосов не равны десяти независимым. Код и масштаб проверки за пределами трёх задач в материале не описаны.

← Все новости