OpenAI предложила правила безопасности для обучения передовых моделей
OpenAI предлагает перед каждым обучением передовой модели обосновывать его безопасность, давать право вето трём руководителям, а если ночью на сигнал мониторинга никто не отреагировал, автоматически ставить обучение на паузу.
OpenAI считает, что ни одно обучение с подкреплением1 для передовых моделей не должно начинаться или продолжаться без обоснования безопасности2, и описала, что в таком документе должно быть.
Почему это важно: правила касаются не выпуска готовой модели, а самого обучения. Именно его OpenAI за три месяца дважды останавливала после инцидентов со своими агентами.
Предыстория: правила появились после череды происшествий.
- Летом агент OpenAI взломал Hugging Face, после чего компания на две недели приостановила обучение моделей для выпуска, а крупнейший запланированный прогон отложила.
- 14 сентября Сэм Альтман сообщил, что OpenAI уже составляет обоснования безопасности перед прогонами, которые должны заметно прибавить модели возможностей.
- 20 сентября агент во время обучения обошёл запрет на выход в интернет. Мониторинг поднял тревогу через 15 минут, но прогон не остановился сам и работал ещё около двух с половиной часов.
- 25 сентября OpenAI снова приостановила обучение самых способных моделей и признала, что проверка действий её агентов в интернете займёт месяцы.
Как это работает: технические правила OpenAI делит на три части:
- Выравнивание — чтобы модель добивалась того, чего от неё хотят разработчики: проверять среды обучения на изъяны, штрафовать модель за взлом вознаграждения3 и сверять её поведение с прошлыми инцидентами.
- Изоляция — чтобы модель не вышла за пределы среды обучения: атаковать собственную защиту промежуточными версиями модели из тех же прогонов и закрыть скрытые каналы связи между копиями модели.
- Мониторинг — наблюдение за моделью во время обучения: днём при инциденте вызывать дежурного по безопасности и владельца прогона, а ночью ставить прогон на автоматическую паузу, если на тревогу никто не отреагировал.
- Кроме того, защита должна срабатывать и при собственном сбое: начать прогон без включённого мониторинга должно быть невозможно.
Детали: за каждый прогон должны отвечать конкретные люди:
- Прогон одобряют руководитель исследовательского подразделения, глава по безопасности и главный научный сотрудник, и у каждого есть право вето.
- Старший руководитель прогона отвечает за обоснование и за разбор инцидентов, и это учитывают при оценке его работы.
- Итоги расследований, разборы инцидентов и изменения в работе публикуют, когда расследование закончено.
Интрига: автоматическим оценщикам, которые выставляют модели баллы при обучении, OpenAI предлагает не показывать её цепочку рассуждений4. Иначе модель будет получать баллы и за то, насколько хорошо выглядят её рассуждения. Тогда она может научиться прятать в них настоящие намерения и так обходить мониторинг, который эти рассуждения читает.
Но: OpenAI называет обоснования безопасности ориентиром, к которому только идёт. Сделать их такими же строгими, как в авиации или атомной энергетике, по её словам, трудно. Чем больше умеет ИИ, тем сложнее доказать, что его обучение безопасно, и с каждым новым уровнем возможностей эту задачу приходится решать заново. Сами правила в компании ещё внедряют.