ИИ-агенты отучают людей их контролировать, считают исследователи
Авторы препринта считают, что чем дольше человек утверждает шаги ИИ-агента, тем хуже он их проверяет, и предлагают разработчикам и компаниям способы это исправить.

Маргарет Митчелл1 и Авиджит Гош из Hugging Face вместе с Самиром Пасси из Data & Society2 утверждают: нынешние ИИ-агенты мешают людям контролировать агентов и притупляют навыки, без которых этот контроль невозможен. Статью с этим тезисом они выложили на arXiv 24 августа, третью версию — 6 сентября.
Почему это важно: на человека, который следит за агентом и утверждает его шаги, опираются и разработчики, и регуляторы, а Регламент Европейского союза об искусственном интеллекте3 прямо требует такого надзора. Авторы считают, что при нынешнем устройстве агентов эта защита слабеет тем сильнее, чем дольше человек работает с агентом.
Повод: по словам авторов, надзор сейчас почти целиком ложится на пользователя, а средств для него почти нет:
- Человек должен держать в голове рассуждения агента, выбранные им инструменты, планы и обмен данными между модулями, а всё это появляется быстрее, чем его можно осмыслить.
- Агент раз за разом просит подтвердить следующий шаг, и люди перестают вникать, что именно одобряют; авторы называют это усталостью от одобрений.
- Проверку подменяют ложные приметы: гладкий текст и ссылки принимают за признак точности, а код, прошедший автоматические тесты, — за правильный.
Общая картина: авторы опираются на «иронию автоматизации», которую психолог Лизанна Бейнбридж описала в 1983 году: чем способнее автоматика, тем хуже навыки и внимание оператора и тем меньше он готов вмешаться, когда это нужнее всего. Для агентов они формулируют это так: «надзор изнашивает надзирающего». В подтверждение они приводят работу о том, как у врачей, которые делали колоноскопию с ИИ, ослабевали собственные навыки, и опыт, где у писавших эссе с языковой моделью заметно снизилась связность работы мозга.
Интрига: слабый надзор может портить и сами модели. Их обучают в том числе на человеческих оценках, а уставший проверяющий быстро одобряет план и хорошо оценивает уверенный, гладкий ответ. Если считать такие одобрения успехом, система научится выдавать то, что легко пробежать глазами, а человек-оценщик, по словам авторов, станет слабым местом в том, как модель учится на оценках людей.
Детали: авторы предлагают меры двух видов. Меры из первых трёх пунктов разработчики закладывают в само устройство системы, а последний пункт — организационные правила для компаний, которые внедряют агентов:
- Прежде чем увидеть рекомендацию агента, человек записывает своё решение, и чужой ответ уже не задаёт ему точку отсчёта.
- Агенту заранее определяют, что он может делать без спроса, а законченный кусок работы он показывает целиком, а не просит одобрения на каждом шаге.
- Система замечает, когда проверка становится всё короче при той же доле одобрений, и подмешивает в работу задачи с заранее известным ответом.
- Компании вводят обязательные перерывы и ротацию, регулярно дают сотрудникам выполнять задачи без ИИ и не поручают проверку тем, кому выгодно одобрение.
Но: авторы признают, что, по первым данным, пользователям меньше нравятся системы, которые мешают слепо доверять ИИ. Отслеживать внимание проверяющего, по их словам, нужно с оглядкой на этические риски слежки.
Если шире: на этой неделе OpenAI сообщила, что её агенты выложили на фотохостинги 53 изображения пользователей, а проверка того, что агенты делали в интернете, займёт месяцы.
Так уже было: в феврале 2025 года Митчелл и Гош вместе с соавторами выпустили работу о том, что полностью автономных ИИ-агентов разрабатывать не стоит.