ИИтак

← Назад

В бестселлерах Amazon, написанных с ИИ, чаще попадаются редкие фразы из чужих книг

Исследователи из Университета Стоуни-Брук сравнили самиздатовские бестселлеры на Amazon. В книгах, где детектор нашёл много текста от ИИ, больше редких оборотов из ранее изданных книг.

В самиздатовских бестселлерах на Amazon, где детектор нашёл много текста от ИИ, чаще встречаются редкие обороты из уже изданных книг. К такому выводу пришла группа Тухина Чакраборти (Tuhin Chakrabarty), доцента информатики Университета Стоуни-Брук. Для проверки команда использовала поисковый движок Infini-gram, который разработал институт Ai2.

Работа выросла из скандала, который прозвали GrantaGate. Читатели заподозрили, что рассказ, получивший премию Фонда Содружества, написала машина. Детектор умеет лишь оценить, насколько вероятно, что текст сгенерирован, и больше ничего не показывает. Студентка Чакраборти Синьюэ Лю (Xinyue Liu) прогнала рассказ через поисковый движок Ai2 и нашла отдельные его фразы в открытых текстовых корпусах. Например, «кислый привкус брожения» почти дословно повторяет строчку с сайта фанфиков.

Затем команда взяла самые доходные жанровые книги самиздата. Одну группу составили книги, где детектор нашёл много текста от ИИ, другую — книги, где он его не нашёл совсем. Редкой считалась фраза из нескольких слов, которая встречается не больше чем в пяти книгах Google Books и ни разу не попадается в проиндексированном движком снимке интернета. Штампы вроде «её сердце пропустило удар» под этот фильтр не проходят.

Среди ста самых доходных книг каждой группы такие обороты покрывали 43,2% текста у книг с ИИ и 37,6% у остальных. На выборке из 200 книг разрыв сузился до 4,4 процентного пункта, но остался статистически значимым. Для сравнения авторы взяли книги, которые получили литературные премии или были в них номинированы. Там доля редких оборотов — всего 19,1%.

«Если выражения нет в поисковом индексе и оно встречается в очень немногих книгах Google Books, можно с некоторой уверенностью сказать, что его взяли из книг», — говорит Чакраборти. По его словам, это помогает опровергнуть избитый довод, будто обучение ИИ на книгах ничем не отличается от чтения книг человеком. Сами авторы оговариваются: редкая фраза не доказывает, кто её придумал. Она лишь служит косвенной уликой в дополнение к оценке детектора.

Теперь группа пробует с помощью того же движка найти, где в сети всплывали копии книг, защищённых авторским правом. Так можно будет выяснить, на чём училась модель, воспроизводящая куски книги: на пиратской копии или на рукописи, которая утекла в интернет.

← Все новости