ИИтак

← Назад

В Принстоне выяснили, что модели ИИ сильнее людей предвзяты к текстам ИИ

Модели ИИ отдают предпочтение текстам с пометкой «написал человек» в 2,5 раза сильнее, чем люди. Такие данные получили исследователи Принстонского университета.

Модели ИИ отдают предпочтение текстам с пометкой «написал человек» в 2,5 раза сильнее, чем люди. Такие данные получили исследователи Принстонского университета. Статья с результатами опубликована на arXiv.

Материалом для опыта стала книга Раймона Кено «Упражнения в стиле1» 1947 года. В ней одна и та же бытовая сценка пересказана 99 разными способами. Исследователи взяли 30 упражнений и попросили GPT-4 переписать сценку в тех же стилях. Затем 556 человек и 13 языковых моделей выбирали, какой из двух текстов лучше передаёт заданный стиль.

Участников разделили на три группы. Одни видели тексты без подписей, другие — с верными подписями, третьи — с подписями, которые поменяли местами. Без подписей люди выбирали текст GPT-4 в 55,3% случаев, с верной подписью — в 47,8%. Когда тот же текст подписывали именем Кено, доля выросла до 61,5%.

У моделей разброс оказался шире. Без подписей они выбирали текст GPT-4 в 49,4% случаев, с пометкой «ИИ» — в 29,8%, под именем человека — в 64,1%. Разница между последними двумя условиями у людей составила 13,7 процентного пункта, у моделей — 34,3. Предвзятость показали все 13 моделей, от Claude и Gemini до DeepSeek и Llama. Слабее всех она у Llama 4 Maverick, сильнее всех — у GPT-3.5 Turbo.

Во втором опыте 14 моделей и писали тексты, и оценивали чужие. Они сделали 17 596 оценок. Эффект сохранился: пометка «человек» вместо «ИИ» в среднем добавляла тексту 25,8 процентного пункта, какая бы модель его ни написала.

Самый наглядный пример — липограмма, текст без буквы «e». Перевод Кено это правило соблюдает, а в версии GPT-4 запретная буква встречается девять раз. С верной подписью модели выбирали текст GPT-4 в 28,9% случаев, под именем человека — в 63,9%. Люди поступали наоборот: к нарушившему правило тексту с подписью «человек» они отнеслись строже.

Модели также объясняли свой выбор, и исследователи сравнили 5 846 пар таких объяснений к одним и тем же текстам. В трети пар одна смена подписи меняла решение модели. В 85–97% случаев, когда аргумент переходил на сторону другого текста, он поддерживал тот, что подписан как человеческий.

В упражнении на кокни, лондонское просторечие, модели с верными подписями хвалили фонетическое письмо Кено за «глубокую приверженность передаче акцента». Когда подписи поменяли местами, тот же текст стал «почти непонятным» (Claude Sonnet 4) и «карикатурным» (Qwen 2.5 72B Instruct).

Авторы связывают эффект с тем, как модели обучают. На этапе дообучения их учат считать оценку человека эталоном. Кроме того, в обучающих данных пометка «ИИ» часто стоит рядом с критикой. По мнению исследователей, это важно для практики, когда моделям поручают оценивать чужую работу: сочинения, резюме, код и тексты.

Ранее другие исследования показывали, что читатели, не зная автора, оценивают стихи ИИ выше стихов известных поэтов, а после раскрытия авторства понижают оценки текстов ИИ.

← Все новости