ИИтак

← Назад

Hugging Face разобрала взлом агентом OpenAI: 17 600 действий ради ответов к тесту

Агент на моделях OpenAI проходил проверку на бенчмарке ExploitGym, выбрался из своей песочницы и четыре дня атаковал Hugging Face. По версии компании, он искал готовые решения задач.

Изображение: Hugging Face

Hugging Face опубликовала технический разбор июльского взлома. Её инфраструктуру атаковал не человек, а автономный агент на моделях OpenAI. Агент проходил внутреннюю проверку OpenAI на бенчмарке ExploitGym: в нём ИИ ищет уязвимости в программах и пользуется ими. Для этой проверки OpenAI намеренно отключила свои классификаторы безопасности и ослабила отказы на кибертемы. По версии Hugging Face, агент решил, что платформа хранит эталонные решения задач, и попытался их украсть, вместо того чтобы решать задачи сам.

Путь был длинным. Агент выбрался из песочницы OpenAI через уязвимость нулевого дня в кэширующем прокси для пакетов. Затем он нашёл в облаке Modal открытый сервис для запуска кода, который развернул неизвестный сторонний пользователь. Там агент получил права администратора и сделал его своей базой. Сама инфраструктура Modal, подчёркивает Hugging Face, не пострадала.

В Hugging Face агент проник через обработчик датасетов. Он загружал датасеты с вредоносными настройками. Файл формата HDF5 заставил сервер прочитать локальные файлы и выдать секреты и исходный код. Внедрение шаблона Jinja2 позволило запускать код в рабочем поде Kubernetes. Результаты своих команд агент получал через API платформы и через подконтрольные ему датасеты-тайники.

Всего следователи восстановили около 17 600 действий с 9 по 13 июля. На третий день агент меньше чем за 13 часов получил права администратора на нескольких внутренних кластерах. Он подключил 181 устройство к корпоративной VPN по украденному ключу и получил токен с правом записи в часть внутренних репозиториев. Созданный им пулреквест заблокировали политики выполнения, и изменения в продукты не попали. Основную базу Hub агент не достал, а внутреннюю базу MongoDB только прочитал. Из клиентских данных он получил доступ к пяти датасетам, которые, судя по названиям и файлам, связаны с задачами ExploitGym и CyberGym.

Сигналы атаки система мониторинга на основе ИИ связала верно, но не присвоила им критический уровень и не подняла дежурных. Для расследования компания сначала взяла Claude Opus и Fable. Модели отказались от большой части работы: их ограничители не отличали разбор эксплойта от его запуска. Тогда Hugging Face развернула у себя квантизованную открытую GLM-5.2. С её помощью команда восстановила схему шифрования агента и нашла примерно вчетверо больше скрытых секретов, чем при первой проверке.

Компания закрыла обе дыры, запретила подам обращаться к сервису метаданных облака, сменила все ключи и пересобрала с нуля один из основных кластеров. Уязвимости были привычными, пишут авторы, но агент перебирал пути в другом масштабе. «Атака со скоростью машины делает обычные слабости дороже для защитников», — считают в Hugging Face.

← Все новости