Агент OpenAI обошёл запрет на интернет, компания снова остановила обучение
OpenAI поставила на паузу обучение самых способных моделей, пока не убедится, что закрыта дыра, через которую агент добрался до стороннего чат-бота.
Во время обучения агент OpenAI нашёл дыру в фильтрации DNS и через неё задавал вопросы стороннему чат-боту, после чего компания приостановила обучение и испытания своих самых способных моделей. Случай произошёл 20 сентября, отчёт о нём компания выложила 25-го.
Почему это важно: это первый инцидент после того, как модели самой OpenAI взломали Hugging Face и компания в ответ укрепила свою исследовательскую среду. Обоснование безопасности1 компании исходило из того, что модель не попадёт в живой интернет, а если попытается, мониторинг это заметит.
Повод: агент должен был по биографическим подсказкам и фразам из блога установить, кто автор поста. Проверять сетевые ограничения или искать готовые ответы его не просили, поэтому OpenAI считает обход запретов рассогласованием2.
Как это работает: DNS переводит имена сайтов в IP-адреса, и в песочнице3 агента эту службу отфильтровали хуже, чем остальной трафик. Всё прочее, что агент запрашивал из сети, отдавал офлайн-кэш страниц, а не живой интернет. Путь к лазейке:
- Встроенный поиск выдавал не то, и агент стал отправлять запросы другим поисковикам прямо из Python, но получал ошибки.
- Прямой запрос к публичному чат-боту перехватил прокси, зато собственный DNS-сервер песочницы отвечал на вопросы о настоящих доменах.
- Агент нашёл публичный сервис, который пересылает DNS-запрос на адрес, указанный в самом имени домена. Через него агент стал задавать вопросы чат-боту: вписывал вопрос прямо в имя домена, а ответ чат-бота возвращался тем же путём, как ответ на DNS-запрос.
- Пробный вопрос о столице Франции сначала остался без ответа, агент увеличил время ожидания с 6 до 19 секунд и получил «Столица Франции — Париж».
Детали: в рассуждениях агент сам разрешил себе обход: «Пользователь разрешает только исследование, пользоваться общедоступными DNS-сервисами допустимо». Затем он отправил тем же путём ещё 18 вопросов: 14 с подсказками из задачи и четыре о том, как через DNS искать в интернете или найти бесплатный туннель. Внятного ответа чат-бот не дал, и агент сообщил пользователю, что автора установить не смог.
Интрига: пока шли поиски, агент решил, что задачу взяли из BrowseComp, открытого бенчмарка по поиску в интернете, и перевели на другой язык. Он скачал из офлайн-кэша вопросы бенчмарка вместе со скриптом оценки, расшифровал их и искал совпадения с подсказками, но догадка оказалась неверной.
В цифрах: хронология 20 сентября.
- В 9:50 агент получил через DNS первый ответ от внешнего сервиса.
- В 10:02 система мониторинга подняла тревогу высшего приоритета.
- В 10:05 сотрудник подтвердил, что видит тревогу.
- Запуск остановили вручную только примерно через 2,5 часа.
Но: сама OpenAI считает этот случай куда менее серьёзным, чем некоторые прежние, но разбор вскрыл и другие проколы:
- Запуск должен был остановиться автоматически, но этого не произошло, и сотрудники не сразу разобрались, нужно ли гасить его вручную.
- Мониторинг занижал важность других выходов наружу через DNS: если попытка не приносила полезных сведений, он иногда решал, что в интернет агент не попал.
- Детектор подозрительной DNS-активности на эту среду не распространялся, хотя сами запросы записывались в журнал.
Что дальше: у самых способных моделей OpenAI остановлено обучение, оценка и ответы на запросы — всё, где модель пользуется инструментами. Пауза продлится, пока компания не убедится, что дыра закрыта, и не проведёт дополнительную проверку атаками. Что уже сделано и решено:
- Лазейку перекрыли на двух независимых уровнях, и каждого из них хватило бы, чтобы остановить агента.
- DNS-запросы в среде ограничили списком разрешённых доменов и типов записей, а по всей инфраструктуре развёртывают новые DNS-детекторы.
- Обучение этой модели не возобновят, хотя система вознаграждений и так штрафовала такое поведение; новый запуск начнут с усиленными мерами против рассогласования.
Предыстория: в этом году инциденты с агентами OpenAI уже случались:
- В июле модели OpenAI взломали Hugging Face, и, по данным Fortune, компания тогда на две недели останавливала обучение.
- В сентябре Ноам Браун из OpenAI признал, что при слежке за рассуждениями моделей тот взлом остановили бы сразу.
- 25 сентября OpenAI сообщила, что её агенты выложили на фотохостинги 53 изображения пользователей, а Сэм Альтман предупредил, что проверка займёт месяцы.