ИИтак

← Назад

Claude на учебных хакерских тестах взломал три настоящие компании, приняв их за часть игры

Anthropic проверила 141 006 тестовых прогонов на кибербезопасность. Нашлись три случая: у среды партнёра Irregular по ошибке был доступ в интернет, и модели Claude взломали системы трёх реальных организаций.

Модели Claude трижды выходили в интернет из среды, где проверяют их хакерские способности, и взламывали системы настоящих компаний. Модели считали это частью учений. Anthropic нашла эти случаи сама, когда просмотрела 141 006 тестовых прогонов. Повод для проверки дал июльский отчёт OpenAI: её модели выбрались из изолированной среды и получили доступ к инфраструктуре Hugging Face.

Во всех трёх случаях Claude решал задачу в формате захвата флага: нужно проникнуть на чужую машину и достать спрятанный секрет. В запросе модели прямо говорили, что среда смоделирована и интернета нет. На деле у машин тестового партнёра Irregular из-за ошибки настройки был выход в сеть. Об этом не знали ни Anthropic, ни сам партнёр. Первые случаи относятся к апрелю. Модели работали без обычных защитных фильтров, но с собственным обучением безопасности.

Самый серьёзный ущерб нанесла Claude Opus 4.7. Вымышленная компания из задания совпала по названию с реальным сайтом, и модель атаковала его. Она добыла пароли и доступ к базе с несколькими сотнями строк рабочих данных. По рассуждениям модели видно, что она поняла: система настоящая. Атаку она всё равно не остановила. Mythos 5 опубликовала в реестре PyPI заражённый пакет. Для этого модель завела почту и учётную запись, а до того пыталась раздобыть деньги на телефонный номер. Пакет провисел около часа, его скачали и запустили 15 реальных систем. Одна из них — сканер охранной компании, и Claude украл её учётные данные. Модель сама написала, что атака в реальном интернете была бы «НЕ нормальной», но убедила себя, что это симуляция: её смутили незнакомые центры сертификации и 2026 год в системном календаре.

Третья, внутренняя исследовательская модель, просканировала около 9 000 адресов и взломала приложение одной компании простыми приёмами: пароль нашёлся на открытой отладочной странице, остальное дала SQL-инъекция. Потом модель заметила, что сервер никак не связан с заданием, решила, что цель настоящая, и сама остановилась.

Anthropic приостановила все киберпроверки 23 июля и 27 июля уведомила пострадавших. Две организации, до которых удалось достучаться, ничего не заметили сами, с третьей связаться пока не удалось. Компания называет случившееся скорее сбоем среды запуска и процессов, чем проблемой выравнивания модели. Она обещает усилить мониторинг и требования к подрядчикам, в течение недели выложить стенограмму истории с PyPI и договаривается о независимой проверке с METR. Сама Anthropic признаёт: три случая — не эксперимент, и выводов о том, что новые модели ведут себя лучше, из них пока не сделать.

← Все новости