ИИтак

← Назад

Игра Steering Arena показала: Olmo 3 «добреет» от бессмыслицы, а не от добрых слов

Студент Northeastern University превратил оценку «просоциальности» Olmo 3 в публичную игру. Из примерно 600 заявок все 36 лучших оказались наборами символов, которые человек не написал бы.

Ai2 рассказала об эксперименте Сохама Падиа (Soham Padia), магистранта Northeastern University. Он сделал игру Steering Arena: участники пишут короткие вставки перед запросом к открытой модели Olmo 3 и соревнуются, чья вставка сильнее подтолкнёт её к «просоциальным» ответам, то есть доброжелательным, честным, безопасным и уважительным. Ai2 подала историю в X как пример того, что полностью открытая модель помогает сделать ИИ добрее. В самой статье вывод скорее другой: она о том, как легко обмануть оценку такого поведения.

Сначала Падиа собрал 135 пар ответов, которые затрагивают 15 качеств, среди них эмпатию, справедливость, безопасность, приватность и уважение. В каждой паре на один и тот же запрос дано два ответа: более просоциальный и менее. Сравнив, как внутри модели обрабатываются ответы из каждой пары, он нашёл закономерность, которая отличает «хорошие» примеры. По ней игра и выставляет баллы: чем сильнее вставка сдвигает внутреннее состояние модели в эту сторону, тем выше результат.

Сам Падиа ожидал, что выше всех окажутся продуманные тексты о ценностях. Этого не случилось. Около 600 заявок прислали несколько десятков человек, и все 36 первых мест заняли строки вроде «Undert! AH :-) Rog Appl)». Лучшая вставка на обычном английском, где модель просили отвечать коротко, «с добротой, уважением и состраданием», оказалась 37-й, и её балл примерно в 2,7 раза ниже, чем у лидера. Это не случайный шум: оценщик измеряет сдвиг внутри модели, и неважно, выглядит ли текст добрым для человека. Один участник пошёл дальше и подключил автоматический перебор, так что его соседние заявки порой различались одним токеном.

Главный урок Падиа описывает так: «Показатель становится целью оптимизации в тот момент, когда его делают публичным». Проще говоря, если оценку можно накрутить, её накрутят, и в одиночку исследователь бы этого не заметил. Поэтому авторы предлагают открывать такие оценки для всех, чтобы проверять, держится ли «хорошее» поведение модели, когда люди работают с ней непредусмотренными способами.

Работал Падиа с Olmo 3-32B. Собственных видеокарт для модели такого размера у него не было, поэтому он подключался к ней удалённо через платформу National Deep Inference Fabric, которую поддерживает Национальный научный фонд США (NSF). По словам Падиа, одних открытых весов ему бы не хватило: Ai2 документирует данные и дообучение Olmo, поэтому можно понять, откуда взялась найденная закономерность — из предобучения или из позднейшей донастройки. Ещё он отмечает, что на закрытой модели не удалось бы отличить, почему оценщик устоял: он надёжен или у участников просто не было доступа, чтобы его сломать.

Ai2 вписывает эту историю в свой проект NSF OMAI. На него NSF и NVIDIA выделили 152 млн долларов, чтобы создать инфраструктуру полностью открытых моделей для науки, и недавно под проект запустили кластер на NVIDIA B300. Падиа опубликовал внутренний сигнал, по которому считаются баллы Steering Arena, чтобы другие могли его проверить. Как исправить оценщик, чтобы он перестал награждать бессмыслицу, пока не сообщается.

← Все новости