OpenAI будет публично разбирать случаи, когда её модели ведут себя не так, как задумано
OpenAI описала порядок, по которому будет отслеживать, расследовать и раскрывать случаи рассогласования своих моделей. Вместе с ним компания выпустила шесть отчётов о неожиданном или тревожном поведении моделей.
OpenAI опубликовала правила, по которым будет сообщать о рассогласовании своих моделей. Так называют случаи, когда модель поступает не так, как задумали разработчики. В правилах три этапа: такие случаи отслеживают, расследуют, а затем раскрывают.
Вместе с правилами компания выпустила первые шесть отчётов. В них разобраны эпизоды, когда модели вели себя неожиданно или тревожно. Выходит, OpenAI не только обещает рассказывать о сбоях, но и сразу показывает, как будут выглядеть такие отчёты.
В августе OpenAI уже говорила, что усиливает мониторинг и выравнивание передовых моделей. Тогда же компания обещала подстраивать темп их разработки под то, насколько модели опасны в кибератаках. Неделей раньше независимые оценщики ИИ получили общий стандарт работы AEF-1. Регулярные отчёты о сбоях продолжают тот же курс: безопасность моделей становится предметом публичной отчётности, а не внутренним делом лабораторий.