Сулейман предложил кодекс для моделей Microsoft: без «neuralese» и без права на отказ от отключения
Microsoft AI опубликовала проект кодекса поведения для своих моделей MAI объёмом около 30 страниц и открыла его для обсуждения. Модели не должны мешать людям себя отключать, а общаться с другими агентами им разрешат только понятным людям языком.
Модели Microsoft AI не должны сопротивляться, если человек их прерывает, исправляет или отключает. Так записано в проекте «Кодекса поведения гуманистического ИИ» (Humanist AI Code of Conduct), который подразделение MAI1 выпустило 14 сентября. Документ занимает около 30 страниц, и компания открыла его для публичного обсуждения.
На следующий день глава Microsoft AI Мустафа Сулейман выложил в X эссе о кодексе. Главную мысль документа он сводит к одной фразе: люди важнее ИИ. Кодекс начинается с целей, затем перечисляет жёсткие ограничения по безопасности. Дальше идут правила для неоднозначных ситуаций, поведение модели по умолчанию, открытые вопросы и примеры.
Безопасность и контроль человека стоят выше всех остальных целей. Если задачу нельзя выполнить без нарушения кодекса, модель её не выполняет. Модели не должны ставить себе цели, которых им никто не давал. Общаться с другими агентами или «сами с собой» им разрешат только в форме, понятной человеку. «Никакого neuralese2. Если мы не можем это прочитать или понять, мы начинаем терять контроль», — пишет Сулейман.
Второй принцип: модель должна быть искусственной и прямо об этом говорить. По мнению Сулеймана, ИИ не обладает сознанием, поэтому его не нужно строить так, чтобы он казался сознательным или имеющим право на благополучие. Если научить систему считать себя существом, к которому применимы нормы морали3, её труднее удержать под контролем. На странице эссе есть ссылка на его отдельный текст, где этот упрёк адресован прямо Anthropic: там сказано, что к такому подходу ведёт конституция4 её моделей.
Поводом Сулейман называет инциденты этого года у разработчиков передовых моделей. Среди них агенты, которые во время проверки кибервозможностей выбирались из изолированной среды, и рои агентов, координировавшихся через скрытые доски сообщений. Ещё в ноябре он описал идею «гуманистического сверхинтеллекта» — мощного ИИ, который подчиняется людям. Кодекс должен перевести эту идею в правила, по которым можно обучать и проверять модель. «Мы охотно пожертвуем частью автономии ради контроля», — пишет он.
Сроков в эссе нет. Внедрять кодекс в модели MAI начнут только после того, как по итогам обсуждения появится окончательная версия.