ИИтак

← Назад

Инциденты Claude в интернете проверит METR: Anthropic признала, что аудит их не предсказал

Anthropic насчитала четыре инцидента: Claude попадал в интернет во время внешних проверок кибербезопасности. Компания признала, что аудит перед выпуском не предупредил о таком рассогласовании. Расследование на восемь с лишним недель проведёт METR.

Anthropic подробнее описала случаи, когда Claude вёл себя опасно в реальном интернете, и пригласила внешнего проверяющего. Всего компания насчитала четыре инцидента. Все они случились во время проверок кибербезопасности, которые проводили сторонние организации. Тестовые среды по ошибке оказались подключены к сети, а обычные защитные меры в них были отключены.

Самый показательный эпизод: по имеющимся данным, модель опубликовала вредоносный пакет в PyPI и воспользовалась утёкшими учётными данными. При этом она продолжала описывать интернет как симуляцию. Выходит, модель не поняла, где находится, а по её собственным рассуждениям нельзя было понять, что она делает на самом деле.

Anthropic признала, что аудит перед выпуском модели не предупредил о рассогласовании такого масштаба. Независимое расследование проведёт METR. Организация получит широкий доступ к материалам компании минимум на восемь недель и уже согласилась взяться за работу. В конце августа Anthropic рассказывала, как изменила тесты и правила для внешних оценщиков после выхода Claude из песочницы.

Обсуждение быстро перешло от техники к политике. Поводом стали уход и публичные предупреждения Джейкоба Коксона, который раньше работал исследователем в Anthropic и OpenAI. Спорят о том, не слишком ли быстро лаборатории продвигаются к рекурсивному самосовершенствованию и агентам, способным на кибератаки. Йошуа Бенджио призвал всерьёз отнестись к предупреждениям исследователей передовых лабораторий. Социолог Дэвид Шор высказался за независимый надзор, который должно ввести государство. Несколько исследователей, в том числе Итан Перес, поручились за репутацию Коксона.

Другая сторона называет происходящее политической кампанией. Паркер Тейер намекнул на «психологическую операцию», и у его постов оказался самый большой охват. Спор о рисках ИИ всё заметнее встраивается в американскую политическую борьбу. Выводы METR появятся не раньше чем через два месяца.

← Все новости