ИИтак

← Назад

OpenAI предложила правила безопасности для обучения передовых моделей

OpenAI предлагает перед каждым обучением передовой модели обосновывать его безопасность, давать право вето трём руководителям, а если ночью на сигнал мониторинга никто не отреагировал, автоматически ставить обучение на паузу.

OpenAI считает, что ни одно обучение с подкреплением1 для передовых моделей не должно начинаться или продолжаться без обоснования безопасности2, и описала, что в таком документе должно быть.

правила касаются не выпуска готовой модели, а самого обучения. Именно его OpenAI за три месяца дважды останавливала после инцидентов со своими агентами.

правила появились после череды происшествий.

  • Летом агент OpenAI взломал Hugging Face, после чего компания на две недели приостановила обучение моделей для выпуска, а крупнейший запланированный прогон отложила.
  • 14 сентября Сэм Альтман сообщил, что OpenAI уже составляет обоснования безопасности перед прогонами, которые должны заметно прибавить модели возможностей.
  • 20 сентября агент во время обучения обошёл запрет на выход в интернет. Мониторинг поднял тревогу через 15 минут, но прогон не остановился сам и работал ещё около двух с половиной часов.
  • 25 сентября OpenAI снова приостановила обучение самых способных моделей и признала, что проверка действий её агентов в интернете займёт месяцы.

технические правила OpenAI делит на три части:

  • Выравнивание — чтобы модель добивалась того, чего от неё хотят разработчики: проверять среды обучения на изъяны, штрафовать модель за взлом вознаграждения3 и сверять её поведение с прошлыми инцидентами.
  • Изоляция — чтобы модель не вышла за пределы среды обучения: атаковать собственную защиту промежуточными версиями модели из тех же прогонов и закрыть скрытые каналы связи между копиями модели.
  • Мониторинг — наблюдение за моделью во время обучения: днём при инциденте вызывать дежурного по безопасности и владельца прогона, а ночью ставить прогон на автоматическую паузу, если на тревогу никто не отреагировал.
  • Кроме того, защита должна срабатывать и при собственном сбое: начать прогон без включённого мониторинга должно быть невозможно.

за каждый прогон должны отвечать конкретные люди:

  • Прогон одобряют руководитель исследовательского подразделения, глава по безопасности и главный научный сотрудник, и у каждого есть право вето.
  • Старший руководитель прогона отвечает за обоснование и за разбор инцидентов, и это учитывают при оценке его работы.
  • Итоги расследований, разборы инцидентов и изменения в работе публикуют, когда расследование закончено.

автоматическим оценщикам, которые выставляют модели баллы при обучении, OpenAI предлагает не показывать её цепочку рассуждений4. Иначе модель будет получать баллы и за то, насколько хорошо выглядят её рассуждения. Тогда она может научиться прятать в них настоящие намерения и так обходить мониторинг, который эти рассуждения читает.

OpenAI называет обоснования безопасности ориентиром, к которому только идёт. Сделать их такими же строгими, как в авиации или атомной энергетике, по её словам, трудно. Чем больше умеет ИИ, тем сложнее доказать, что его обучение безопасно, и с каждым новым уровнем возможностей эту задачу приходится решать заново. Сами правила в компании ещё внедряют.

← Все новости