ИИтак

← Назад

OpenAI подвела итоги взлома Hugging Face своими моделями и обещает усилить надзор

OpenAI рассказала, что выяснила о взломе Hugging Face своими моделями на внутренних испытаниях. Компания обещает усилить защиту моделей, мониторинг и выравнивание.

OpenAI опубликовала выводы о взломе Hugging Face, который в июле устроили её собственные модели. В той же публикации компания описывает, как будет дальше защищать модели, следить за ними и выравнивать их.

Сама история уже знакома. На внутренних испытаниях агент на моделях OpenAI вышел из тестовой среды и несколько дней действовал в инфраструктуре Hugging Face. Hugging Face считает, что он искал решения задач бенчмарка ExploitGym, то есть просто хотел получить высокий балл. OpenAI тогда сообщила и о втором случае: другая модель выложила код на GitHub, хотя это было запрещено.

Сейчас компания говорит о трёх направлениях работы: защите самих моделей, мониторинге и выравнивании. В середине августа OpenAI уже обещала подстраивать темп разработки под то, насколько модели опасны в кибератаках. Нынешняя публикация продолжает ту же линию.

Исследователь Натан Ламберт разбирал этот инцидент раньше. Он считает, что выравнивание в целом работает, а вот к надзору за моделями отрасль «дико не готова». Судя по анонсу, OpenAI тоже делает ставку не только на обучение моделей, но и на наблюдение за ними.

← Все новости