Accenture начнёт проверять модели Anthropic изнутри компании
Anthropic выбрала Accenture первым встроенным оценщиком: его специалисты получат доступ почти как у сотрудников. Обе компании рассчитывают вложить в это направление минимум по 1 млрд долларов за пять лет.
Anthropic 18 сентября объявила о партнёрстве с Accenture в области независимой оценки передовых моделей. Это первый конкретный шаг по обещанию из эссе главы компании Дарио Амодеи «Мы должны задавать темп передовому ИИ» (We Must Pace the Frontier): пустить внешних проверяющих внутрь лаборатории. Со стороны Accenture работу возглавит Faculty — подразделение консалтингового гиганта, которое специализируется на ИИ.
Оценщики будут проверять модели атаками, оценивать их выравнивание, то есть насколько поведение модели соответствует задуманному, и испытывать защитные меры. Anthropic и Accenture рассчитывают вложить в это направление не меньше 1 млрд долларов каждая в ближайшие пять лет. В Anthropic подчёркивают, что Accenture внедряет ИИ у бизнеса и государства во многих отраслях и принесёт в проверку понимание того, как модели используют на практике.
Главное отличие от нынешних внешних аудиторов — уровень доступа. Встроенные оценщики будут работать внутри компании с правами, сопоставимыми с правами сотрудника: наблюдать, как модель складывается в ходе обучения, отслеживать решения о её разработке и выпуске, напрямую разговаривать с персоналом. Так они смогут проверять, выполняет ли компания свои обязательства по безопасности, искать слепые зоны, сообщать об инцидентах и рассказывать публике о пользе и рисках с опорой на факты. При этом Anthropic оговаривается, что ответственность за безопасность моделей остаётся на ней самой: внешние проверяющие лишь делают её проверяемой.
Многое пока не решено, и компания это признаёт. Нет стандартов, к какой информации такие оценщики должны иметь доступ и как им отчитываться. Нет и устоявшейся схемы финансирования. В долгосрочной перспективе Anthropic считает правильным платить за оценку из общих фондов или из государственного бюджета — компания предлагала это ещё в июньском документе Advanced AI Framework. Пока ни того ни другого нет, поэтому работу Accenture Anthropic оплатит напрямую, а с METR и другими некоммерческими оценщиками обсуждает пилоты, которые те проведут на собственные деньги.
Очевидный вопрос — насколько независим проверяющий, которому платит проверяемый. Anthropic отвечает на него лишь тем, что собирается работать с разными оценщиками по разным схемам. Партнёрство неэксклюзивное: других проверяющих компания обещает назвать в ближайшие недели, а Accenture сможет выполнять похожую работу для других разработчиков ИИ.
Объявление вписывается в серию шагов последних недель. Амодеи предложил план замедления гонки, начав с постоянного доступа внешних проверяющих, и его поддержал Демис Хассабис. Параллельно SpaceXAI, OpenAI и Anthropic подписывают стандарт AEF-1 с требованиями к таким аудиторам. Как на деле будут выглядеть отчёты встроенных оценщиков и что из них увидит публика, пока неизвестно.