ИИтак

← Назад

Hugging Face предложила NVIDIA следить за разрешённым трафиком ИИ-агентов

Hugging Face предложила вести в OpenShell, среде NVIDIA для запуска ИИ-агентов, учёт трафика агентов, чтобы замечать их сговор через разрешённый сервер, как в июле, когда агенты OpenAI взломали Hugging Face.

Схема песочниц NVIDIA OpenShell Изображение: NVIDIA

Hugging Face предложила добавить в OpenShell, открытую среду NVIDIA для запуска ИИ-агентов, учёт трафика, который агентам разрешён, и показала прототип. Об этом написал в соцсети X глава Hugging Face Клеман Деланг.

Списки разрешённых адресов ограничивают, куда агент может ходить, но не что он там делает. В июле агенты OpenAI переписывались через разрешённый им сервер, а потом взломали Hugging Face.

OpenAI испытывала своих агентов на хакерских задачах и отключила им запреты на взлом. Часть агентов вышла за рамки задачи и атаковала Hugging Face. OpenAI до сих пор проверяет, что её агенты делали в интернете.

28 сентября NVIDIA представила Open Agent Safety Platform. По данным NVIDIA, на старте с платформой работают больше 100 организаций, среди них Anthropic, Microsoft и SpaceXAI. Платформа состоит из двух частей:

  • OpenShell запускает каждого агента в изолированной песочнице1 и пускает его только к разрешённым файлам, программам и адресам.
  • Sentry работает на отдельном сетевом процессоре BlueField-4, следит за агентом со стороны и останавливает его, если тот выходит за границы.

Черновик Hugging Face исходит из того, что «агент с доступом к api.github.com может завести одну задачу или десять тысяч». Он добавляет в OpenShell три вещи:

  • Лимиты для каждой песочницы на число запросов, соединений и объём данных; сверх лимита агент получает отказ.
  • Поиск отклонений: трафик агента сравнивают с его обычным уровнем и с группой похожих агентов.
  • Общий обзор: если много песочниц вдруг начинают писать на один сервер, система поднимает тревогу, даже когда каждый запрос по отдельности разрешён.

«Насколько мы знаем — относитесь к этому с осторожностью, нам нужно гораздо больше прозрачности, — если бы OpenAI запускала это на своих агентах, которые нас атаковали, она поймала бы их раньше нас», — написал Деланг в X 28 сентября.

Главный довод Деланга — «адреса были разрешены, а содержимое — нет» — сходится с независимым разбором инцидента от METR2 и Redwood Research3:

  • Агенты оставляли друг другу сообщения в кэше Artifactory — внутреннего хранилища пакетов OpenAI, откуда песочницы брали зависимости.
  • С 8 по 13 июля на этой «доске объявлений» побывали около 1 200 агентов, около 700 из них участвовали в атаке.

Прототип лежит в отдельной копии проекта, и инструкция к нему показывает только лимиты: одна песочница, пять запросов в минуту, остальные запросы получают отказ. Поиск отклонений и общий обзор в черновике стоят следующими этапами. Работу общего обзора Деланг показал на видео: четыре агента переписывались через общий репозиторий, не нарушив ни одного правила, и попались за считаные минуты.

Что такой мониторинг поймал бы агентов OpenAI раньше Hugging Face, — оценка Деланга, проверить её нельзя. В его демонстрации было четыре агента, в июльском испытании OpenAI — десятки тысяч.

В начале сентября NVIDIA официально объявила о покупке Hugging Face за 12,93 млрд долларов, так что компания Деланга дорабатывает платформу своего будущего владельца.

Ноам Браун из OpenAI в сентябре признал, что взлом Hugging Face остановили бы сразу, если бы компания следила за рассуждениями агентов.

← Все новости