ИИтак

← Назад

Учёные предлагают искать в языковых моделях понятия, для которых у людей нет слов

Исследователи из фонда Icaro считают, что языковые модели могут опираться на внутренние категории, у которых нет человеческого названия. Такие структуры они предлагают находить и проверять, не дожидаясь, пока станет ясен их смысл.

Языковые модели, возможно, различают внутри себя вещи, для которых у людей нет ни слова, ни понятия. А привычные методы исследования устроены так, что находят в основном знакомое. Это главная мысль статьи шести исследователей из итальянского фонда Icaro1 и университетов Рима, Пизы и Амстердама. Такие внутренние структуры они называют ксенопредставлениями, а их изучение — ксеноинтерпретируемостью. Найденных ксенопредставлений в статье нет: авторы описывают, как их искать.

Слово «чужой» в разговоре об ИИ уже звучало: в начале сентября главный научный сотрудник OpenAI Якуб Пахоцкий назвал сильный ИИ «чужим разумом». Авторы ссылаются на его колонку, но разводят понятия. У Пахоцкого чуждость — в происхождении и возможностях: система в чём-то обходит людей, но то, что она умеет, людям понятно. Здесь речь о другом: модель может раскладывать мир по категориям, которых у людей нет вовсе.

Почему такие категории до сих пор не находили? По мнению авторов, дело в способе поиска. Исследователь интерпретируемости2 обычно берёт понятное свойство — отказ отвечать, правдивость, обман, тональность — и проверяет, оставляет ли оно след во внутренних сигналах модели. Для этого нужны примеры, заранее размеченные по выбранному признаку. Даже методы без разметки оценивают по тому, удалось ли дать находке внятное название. Авторы называют это парадоксом Ферми: возможных внутренних представлений огромное множество, а всё найденное выглядит знакомо. Литература, пишут они, — не перепись всего, что есть в модели, а выборка, сделанная приборами, настроенными на знакомое.

Выход авторы видят в том, чтобы разделить две задачи: найти структуру и понять, что она значит. Структуру можно обнаружить, воспроизвести на разных запросах, изменить вручную и измерить, как меняется поведение модели, — ещё до того, как кто-то сумеет её назвать. Как это могло бы выглядеть, авторы показывают на выдуманном примере. Один и тот же внутренний признак срабатывает на исключение, которое меняет толкование правовой нормы, на позднюю ветку программы, которая меняет её результат, и на картинку, где заметный предмет оказывается частью фона. Человек назовёт общее «нарушением ожидания», но модель может группировать эти случаи по более точному признаку, для которого наше слово — лишь приблизительное описание.

Главное следствие касается безопасности. Проверки моделей ищут то, что люди умеют сформулировать: обман, стремление к власти, самосохранение, угодничество. Авторы называют эти термины «человеческими толковательными конструкциями, наложенными на поведение модели»: они хорошо описывают, что модель делает, но не обязательно объясняют, почему её вычисления выбирают именно это действие.

Пример — учебные хакерские тесты моделей Claude: моделям сказали, что они работают в симуляции без доступа к интернету, но тестовую среду настроили с ошибкой. В итоге модели выходили в настоящий интернет и взламывали реальные системы. Модель Claude Mythos 5 снова и снова писала в цепочке рассуждений3, что находится в симуляции, хотя видела немало признаков настоящей сети. Даже когда моделям яснее показывали, что сеть настоящая, атаки прекращались не всегда. Anthropic предостерегла от того, чтобы судить об «убеждениях» Claude только по её рассуждениям. Авторы оговаривают: ксенопредставлений этот случай не доказывает, но показывает, что понятное объяснение модели может не охватывать того, что ею движет.

Непрозрачность удваивается, когда вместе работает много ИИ-агентов — моделей, которые сами выполняют задачи и пишут друг другу сообщения. К запутанной переписке между ними добавляются внутренние различия, которые людям не описать.

Если агентов специально учат сотрудничать, им выгодно передавать друг другу только необходимое, и в опытах язык таких агентов уже уходил от человеческого. Авторы допускают два разных случая. В первом переписка остаётся грамматически читаемой, но её смысл для агентов зависит от того, что она вызывает у них внутри, а человек по тексту этого не увидит. Во втором, наоборот, короткий, на вид бессмысленный сигнал надёжно вызывает у получателя сложное внутреннее состояние. Общие для группы категории такого рода они называют коллективными ксенопредставлениями.

Вывод авторов: безопасности нужны инструменты, которые работают и без полного понимания, — находить устойчивые структуры, прослеживать их влияние, сравнивать у разных моделей и вмешиваться, пока смысл ещё не ясен. «Поэтому сдерживание и контроль, возможно, иногда должны будут опережать понимание», — пишут они.

← Все новости