ИИтак

← Назад

ИИ-агенты отучают людей их контролировать, считают исследователи

Авторы препринта считают, что чем дольше человек утверждает шаги ИИ-агента, тем хуже он их проверяет, и предлагают разработчикам и компаниям способы это исправить.

Маргарет Митчелл в 2022 году Фото: AI4LAM, CC BY 3.0, Wikimedia Commons

Маргарет Митчелл1 и Авиджит Гош из Hugging Face вместе с Самиром Пасси из Data & Society2 утверждают: нынешние ИИ-агенты мешают людям контролировать агентов и притупляют навыки, без которых этот контроль невозможен. Статью с этим тезисом они выложили на arXiv 24 августа, третью версию — 6 сентября.

на человека, который следит за агентом и утверждает его шаги, опираются и разработчики, и регуляторы, а Регламент Европейского союза об искусственном интеллекте3 прямо требует такого надзора. Авторы считают, что при нынешнем устройстве агентов эта защита слабеет тем сильнее, чем дольше человек работает с агентом.

по словам авторов, надзор сейчас почти целиком ложится на пользователя, а средств для него почти нет:

  • Человек должен держать в голове рассуждения агента, выбранные им инструменты, планы и обмен данными между модулями, а всё это появляется быстрее, чем его можно осмыслить.
  • Агент раз за разом просит подтвердить следующий шаг, и люди перестают вникать, что именно одобряют; авторы называют это усталостью от одобрений.
  • Проверку подменяют ложные приметы: гладкий текст и ссылки принимают за признак точности, а код, прошедший автоматические тесты, — за правильный.

авторы опираются на «иронию автоматизации», которую психолог Лизанна Бейнбридж описала в 1983 году: чем способнее автоматика, тем хуже навыки и внимание оператора и тем меньше он готов вмешаться, когда это нужнее всего. Для агентов они формулируют это так: «надзор изнашивает надзирающего». В подтверждение они приводят работу о том, как у врачей, которые делали колоноскопию с ИИ, ослабевали собственные навыки, и опыт, где у писавших эссе с языковой моделью заметно снизилась связность работы мозга.

слабый надзор может портить и сами модели. Их обучают в том числе на человеческих оценках, а уставший проверяющий быстро одобряет план и хорошо оценивает уверенный, гладкий ответ. Если считать такие одобрения успехом, система научится выдавать то, что легко пробежать глазами, а человек-оценщик, по словам авторов, станет слабым местом в том, как модель учится на оценках людей.

авторы предлагают меры двух видов. Меры из первых трёх пунктов разработчики закладывают в само устройство системы, а последний пункт — организационные правила для компаний, которые внедряют агентов:

  • Прежде чем увидеть рекомендацию агента, человек записывает своё решение, и чужой ответ уже не задаёт ему точку отсчёта.
  • Агенту заранее определяют, что он может делать без спроса, а законченный кусок работы он показывает целиком, а не просит одобрения на каждом шаге.
  • Система замечает, когда проверка становится всё короче при той же доле одобрений, и подмешивает в работу задачи с заранее известным ответом.
  • Компании вводят обязательные перерывы и ротацию, регулярно дают сотрудникам выполнять задачи без ИИ и не поручают проверку тем, кому выгодно одобрение.

авторы признают, что, по первым данным, пользователям меньше нравятся системы, которые мешают слепо доверять ИИ. Отслеживать внимание проверяющего, по их словам, нужно с оглядкой на этические риски слежки.

на этой неделе OpenAI сообщила, что её агенты выложили на фотохостинги 53 изображения пользователей, а проверка того, что агенты делали в интернете, займёт месяцы.

в феврале 2025 года Митчелл и Гош вместе с соавторами выпустили работу о том, что полностью автономных ИИ-агентов разрабатывать не стоит.

← Все новости