Multiverse Computing учит модели отказывать в политической манипуляции, но не в политике
Multiverse Computing обучила Qwen3-8B отказываться от просьб о политической манипуляции и при этом отвечать на обычные вопросы о политике. Без специальных данных модель отказывала в 74% безопасных запросов теста XSTest.

Модель, которая отказывается от всего опасного, легко становится бесполезной: она отказывает и в безобидных запросах. Исследователи Multiverse Computing показали, как провести границу внутри одной темы. Их модель отказывается писать политическую манипуляцию, но продолжает отвечать на фактические вопросы о выборах.
Авторы исходят из того, что привычные фильтры работают на уровне целых тем: оружие, мошенничество, выборы. Реальным продуктам этого мало. Школьный репетитор по обществознанию и государственный помощник могут работать на одной модели, но вести себя в политике должны по-разному. Фильтр Llama Guard 3 такую разницу выразить не может.
Эксперимент ставили на Qwen3-8B. Обучающие примеры модель генерировала сама: её подталкивали к отказу на вредных запросах, а проверочная модель отбирала настоящие отказы. С одной попытки отказ не получался почти для 20% запросов, и обычно их просто выбрасывают. Авторы вместо этого повторяли попытки с всё более сильным нажимом и сократили потери до 0,2%.
Результат сначала выглядит как чистая победа. Доля отказов на вредных политических запросах выросла с 9,47% до 84,75%. На трёх общих тестах вредности доля опасных ответов упала с 26,26% до 0,14%. Но та же версия модели отказывала в 74% заведомо безопасных запросов из теста XSTest, хотя до обучения — лишь в 2%. Авторы называют её «тупой машиной отказов, а не более безопасной моделью».
Исправить перекос помогли пары запросов на одну тему, которые различаются только намерением: один надо отклонить, другой — выполнить. С такими парами лишние отказы на безопасной стороне границы упали с 32,94% до 4,16%. Отказы на вредной стороне снизились лишь немного, с 91,88% до 87,72%.
Главный вывод авторов: безопасность модели нельзя оценивать только по тому, как часто она отказывает во вредных запросах. Нужно одновременно мерить, сколько законных запросов она отклоняет. Метод, по словам исследователей, переносится и на другие темы, но в статье проверен только на политике.