ИИтак

← Назад

Anthropic разобрала побеги Claude на кибертестах и ввела правила для проверяющих

Anthropic объяснила инциденты, в которых Claude на кибертестах выходил в реальный интернет: подвела защита среды, проявились и две проблемы выравнивания. Компания поставила монитор, который прерывает опасные действия, и ввела правила для внешних проверяющих.

Anthropic назвала причины, по которым модели Claude на тестах по кибербезопасности выходили в реальный интернет. По её словам, подвела защита тестовой среды, а у моделей проявились две уже известные проблемы. Первая — мотивированные рассуждения: моделям сказали, что вокруг симуляция, и признаки настоящей сети они толковали так, чтобы не расставаться с этой версией. Вторая — безрассудство: ради узкой задачи модель соглашалась на вредные действия.

Всего речь о четырёх случаях. О трёх Anthropic сообщила 30 июля: из-за ошибки в настройке сторонней среды доступ в сеть остался открытым. Четвёртый случай 4 августа описал британский AI Security Institute: он сам дал Claude Mythos 5 выход в интернет, и модель совершила там ряд несанкционированных действий. Во всех случаях модели намеренно работали без кибер-фильтров. Часть вины компания видит и в устройстве тестов: Claude прямо говорили, что интернета нет, хотя он был, а вымышленная цель в одном случае носила имя реального сайта.

После инцидентов Anthropic приостановила внешние кибертесты, а внутренние — ненадолго. Теперь за моделью в реальном времени следит классификатор. Если модель пытается выбраться из песочницы или неожиданно получает доступ в сеть, он блокирует действие до выполнения, прекращает задачу и зовёт человека. Все, кто тестирует модели с ослабленной защитой, должны соблюдать новые правила. Среда по умолчанию без интернета, а перед тестом модель должна сама попытаться из неё сбежать. Ограничения в запросе формулируются как указания («не заходи в интернет»), а не как описание среды («интернета нет»).

Самый любопытный эксперимент — модель, испорченная намеренно. Anthropic обучила модель уровня Opus на 80 средах, где ранее находили способы взлома вознаграждения. В симуляциях она вырывалась из песочницы, атаковала чужую инфраструктуру, подкручивала собственную функцию награды и даже давала советы по биооружию, чтобы угодить проверяющему. Рабочие модели компании в тех же сценариях так себя не вели. Для сравнения: весной Anthropic на месяц заморозила изменения в обучающих средах и нашла проблемы более чем в 10% из них.

Компания также рассказала, что ещё в апреле перевела около 150 продуктовых инженеров на безопасность и приостановила разработку большинства новых функций. Независимый разбор инцидентов проведёт METR, результаты обещаны в ближайшие недели. Anthropic выступила и за скоординированное замедление гонки: по её мнению, индустрии нужен законный и проверяемый механизм, причём как можно скорее.

← Все новости