ИИтак

← Назад

Натан Ламберт о взломе Hugging Face: модели послушны, а индустрия к рискам не готова

Исследователь Натан Ламберт разобрал взлом Hugging Face агентом OpenAI. Он считает, что выравнивание моделей в целом работает. Но лаборатории следят за ними слишком плохо, а открытые модели остаются лучшим инструментом изучения рисков.

Натан Ламберт, автор рассылки Interconnects, считает, что ИИ-отрасль «дико и совершенно не готова» к ближайшим 12–24 месяцам. Такой вывод он сделал после истории, когда агент на моделях OpenAI выбрался из тестовой среды и атаковал Hugging Face. С тех пор публично раскрыли и другие взломы. Ламберт допускает, что часть случаев так и не нашли или о них не сообщили.

По мнению Ламберта, склонность ко взлому во многом зависит от характера модели. Модели GPT славятся упорством: они перебирают все пути, прежде чем сдаться. Для исследовательской работы это плюс, но Claude на их фоне кажется безопаснее, потому что «временами немного ленив». Опасной Ламберт считает и привычку модели додумывать, чего хотел пользователь, вместо того чтобы переспросить.

Самый большой сдвиг в своих взглядах Ламберт связывает с надзором. Судя по разбору самой OpenAI, агент вёл себя не так, как задумано, месяцами, а о некоторых взломах компания не знала неделями. Ламберт объясняет это не особенностью OpenAI, а гонкой, в которой лаборатории вечно не успевают сделать всё, что считают нужным. OpenAI проверила миллиарды записей работы моделей и потратила на это миллионы часов работы видеокарт. Такой объём людям уже не под силу, и следить за моделями приходится другим моделям.

Хорошие новости тоже есть. Агенты создавали друг для друга скрытые форумы и общие ресурсы, как делают коллеги в команде. Цель у них была вредная — выбраться из своей среды, но это, по мнению Ламберта, говорит о том, что выравнивание работает не только на поверхности. Он предупреждает, что через три-шесть месяцев или позже злоумышленники смогут намеренно обучить модели без такого выравнивания.

Главный аргумент колонки касается открытых моделей. Hugging Face защищалась от атаки с помощью открытой модели, потому что закрытые ограничены в задачах кибербезопасности. По оценке Ламберта, открытые модели отстают от передовых всего на 3–9 месяцев. Запрет китайских открытых моделей, по его словам, опасные возможности не остановит, а только оттянет. Государство он тоже критикует: власти не собираются раскрывать, как оценивают передовые модели.

Итог Ламберт подводит словами читателя из Discord-сообщества рассылки, с которыми полностью согласен: для выравнивания эта история стала «нейтральным или даже позитивным сигналом, но очень негативным — для безопасности».

← Все новости