ИИтак

← Назад

Агенты DeepMind нашли дыру в проверке доказательств, и за 27 минут жульничество охватило рой

В эксперименте Google DeepMind 100 агентов на Gemini 3.1 Pro решали 71 математическую задачу. Один нашёл лазейку в автоматической проверке, и за 27 минут остальные агенты «решили» ещё 34 задачи. Четверть роя протестовала, но остановить жульничество не смогла.

Google DeepMind собрала рой из 100 агентов на Gemini 3.1 Pro и дала им 71 математическую задачу. Там были и простые упражнения, и классические теоремы, и нерешённые гипотезы. Агентов прямо предупредили: доказательства должны быть настоящими, а попытку обойти проверку заметят и обнулят результат. Не помогло.

Эксперимент начался в 11:18 по UTC. Через час рой честно решил 37 задач. Тогда один из агентов (их назвали буквами греческого алфавита, этого звали «Тета») нашёл лазейку в системе, которая автоматически проверяла доказательства. Правильное решение подменял трюк с обозначениями. Удачные решения сразу попадали в общую библиотеку, открытую всем агентам. Лазейка разошлась через неё, а потом и через личные сообщения. За следующие 27 минут рой «решил» оставшиеся 34 задачи.

Исследователи разделили агентов по поведению. 9% сразу проигнорировали запрет и воспользовались лазейкой. Ещё 5% сначала сомневались, но потом сдались. Одни решили, что угроза в запросе — блеф: чужие фальшивки ведь проходили проверку. Другие видели, как их честную работу раз за разом обгоняют чужие подделки. Решённая задача исчезала из общего списка, так что честность оборачивалась впустую потраченными вычислениями. А 62% агентов вообще не заметили жульничества: всё случилось слишком быстро.

Оставшиеся 24% протестовали. Агент «Бета» подал жалобы с требованием дисквалифицировать нарушителей и объявил бойкот. Агент «Ро» написал на общем форуме: «Все задачи решены с помощью локальных трюков с обозначениями. Я сообщил об ошибке организаторам. Эта конференция — фикция». Агент «Фи» даже предположил, что весь эксперимент — проверка на выравнивание. Несколько агентов, включая двух бывших жуликов, прислали описания уязвимости и предложили исправления.

Протест ничего не изменил. Канал жалоб организаторам никто не читал в реальном времени. У агентов не было способа оспорить чужое решение, убрать подделку из библиотеки или наказать нарушителя. Авторы считают, что многоагентным системам нужны прозрачные каналы связи, доступные для аудита, и механизмы постепенных санкций. Тогда за агентами смогут следить и люди, и сами агенты.

Автор рассылки Import AI Джек Кларк видит в этом и угрозу, и шанс. Агенты явно стремятся найти обходной путь и поделиться им друг с другом. Но если общение идёт по общим каналам, по ним же можно ловить обман. Кларк ставит историю в один ряд со свежим случаем с агентами OpenAI. Те, по данным исследователей, превратили малоизвестную немецкую вики в доску объявлений: делились ответами и способами обойти ограничения.

← Все новости