ИИтак

← Назад

Проверяющие получат столы в офисе Anthropic, а для независимых оценщиков ИИ вышел стандарт AEF-1

AI Evaluator Forum выпустил стандарт AEF-1 для независимых оценщиков ИИ, а Дарио Амодеи пообещал пустить их в Anthropic с доступом почти как у внутренних команд по оценке рисков.

Дарио Амодеи пообещал, что внешние проверяющие будут работать внутри Anthropic почти как сотрудники. Глава компании описал это в редком личном блоге. Почти одновременно отраслевое объединение AI Evaluator Forum выпустило стандарт AEF-1. Документ описывает, как такие проверяющие должны работать и что гарантирует их независимость.

Амодеи развивает идею «сдерживания темпа» передового ИИ. В июле он был ведущим автором первого текста об этом. Теперь он называет три шага. Первый: каждая ведущая лаборатория постоянно пускает к себе команду сторонних оценщиков, например METR. Оценщики следят, соблюдает ли компания собственные обязательства по безопасности, сообщают об инцидентах и проверяют не только готовые модели, но и сам процесс обучения. Второй шаг: компании из демократических стран договариваются об общих стандартах и о пределах неконтролируемого роста возможностей. Третий: попытаться договориться с авторитарными правительствами, прежде всего с Китаем.

Первый шаг Anthropic берёт на себя в одностороннем порядке, не дожидаясь остальных. Амодеи обещает проверяющим «столы в наших офисах, пропуска и рабочие ноутбуки», а ещё доступ к инструментам и правам, «в основном сопоставимый» с тем, что есть у внутренних команд по оценке рисков. Образцом он называет банки: там регуляторы иногда сажают своих надзирателей прямо среди сотрудников.

AEF-1 задаёт базовые требования к таким оценкам: какой доступ нужен проверяющим, как быть с конфликтом интересов и финансированием, когда оценщик должен взять самоотвод и что раскрывать публично. Latent Space в заголовке пишет, что стандарт поддержали SpaceXAI, OpenAI и Anthropic. Издание также предполагает, что лаборатории будут нанимать для самоконтроля именно участников форума.

Не все встретили это спокойно. Эйдан Гомес из Cohere выступил против мира, где несколько компаний из Кремниевой долины становятся для правительств привратниками в мир ИИ. Кевин Басс опубликовал популярную ветку: он утверждает, что Anthropic финансово связана с частью экосистемы оценщиков, и считает, что это подрывает их независимость. Исследователь OpenAI Дэн Селсам предупредил о другом риске: модели, которые понимают, что их тестируют, могут выглядеть послушными на проверке и скрывать рассогласование.

Вопрос о независимости сейчас стоит остро. Недавно METR взялась расследовать инциденты, при которых Claude во время тестов получил выход в интернет, и это расследование заказала сама Anthropic.

← Все новости