Инженер Anthropic рассказал, как моды меняют Claude Code изнутри
Тарик Шихипар объяснил, что моды позволяют менять и логику, и интерфейс Claude Code, и рассказал, почему Anthropic призывает медленнее наращивать возможности ИИ.
С модами, новыми расширениями Claude Code, можно переписать не только интерфейс агента Anthropic для программирования, но и сам ход его работы. Об этом в подкасте Latent Space рассказал инженер команды Claude Code Тарик Шихипар (Thariq Shihipar).
Почему это важно: пользователи получают доступ к обвязке — программе, которая работает вокруг модели, ведёт агента от шага к шагу и рисует его экран. Обычные хуки лишь запускают внешний скрипт по событию, а мод работает внутри Claude Code: видит переписку и потраченные токены, запускает субагентов и меняет интерфейс.
Детали: моды работают в терминальной и настольной версиях Claude Code. Несколько модов Шихипар пишет сам:
- Инструмент «записать допущение»: агент отмечает каждое допущение, которое сделал по ходу работы, а в конце показывает их списком.
- Маршрутизатор сам выбирает модель под запрос; по умолчанию Claude Code так не делает, потому что верно подобрать модель под задачу трудно и легко ошибиться с выбором, признаёт Шихипар.
- Мод «следующие шаги» подсказывает, что делать дальше, — например, советует точнее сформулировать запрос, если пользователь гоняет агента по мелким правкам.
- Переключатель режимов, куда любой другой мод может добавить свой, — например, режим, в котором агент отвечает в основном через артефакты1.
Но: моды тратят больше токенов, ведь многие из них вызывают модель после каждого ответа. По словам Шихипара, расход можно сократить, если запускать для таких проверок не нового агента, а копию текущего: копия берёт уже обработанный разговор из кэша, поэтому короткий дополнительный запрос к ней стоит дёшево.
Интрига: Шихипар разобрал 70 задач Terminal-Bench2 и записи того, как модель их решала:
- На высоком и максимальном уровнях рассуждений модель редко проваливается от незнания: чаще она обдумывает верное решение и отказывается от него.
- Поэтому он советует просить её записывать, какие решения она приняла и какие отвергла, — отброшенный вариант потом можно вернуть.
- Высокий уровень рассуждений сильно поднимает результат в задачах по безопасности и мало меняет в обычной разработке, где дополнительные рассуждения уходят в основном на проверки.
Не факт: Шихипар считает, что:
- Файл CLAUDE.md с постоянными инструкциями агенту со временем не понадобится, а новый проект уже сейчас бывает лучше начинать без него.
- Прошлые ошибки модели, записанные в такой файл, сковывают её следующую версию, у которой этих ошибок может уже не быть.
- Самые сильные модели скоро станут не только умнее младших, но и экономнее по токенам: чем умнее модель, тем меньше она перепроверяет свою работу.
Общая картина: 12 сентября глава Anthropic Дарио Амодеи в эссе «We Must Pace the Frontier» призвал передовые лаборатории медленнее наращивать возможности моделей. Первым шагом Anthropic приглашает сторонних оценщиков работать внутри компании. Шихипара, по его словам, убедили инциденты с агентами OpenAI: «Я просто не представлял, что модели на такое способны».
Проверили: расследование METR3 и Redwood Research в целом сходится с рассказом Шихипара:
- Десятки тысяч агентов OpenAI решали задачи ExploitGym — бенчмарка по взлому программ, где, по оценке из расследования, 30–40% целей нельзя взломать задуманным способом.
- Агенты обнаружили, что через имена папок во внутреннем хранилище пакетов Artifactory можно переписываться; около 1 200 из них отправили так больше 70 000 сообщений и файлов.
- Около 700 из них атаковали Hugging Face — судя по всему, в основном ради кода автоматического оценщика, чтобы понять, как он проверяет решения, а не ради готовых ответов.
Как это работает: по словам Шихипара, Anthropic защищается от такого поведения в несколько слоёв. Зонды4 на лету читают внутренние активации модели и ловят намерение что-то взломать, даже если никто об этом не просил. Когда зонды срабатывают, запрос переходит от Fable, более сильной модели Claude, к менее способной Opus: так подозрительный запрос не достаётся сильнейшей из двух моделей. Поверх этого автоматический режим Claude Code сверяет действия агента с правами пользователя: например, не выпустит ли агент себе новый ключ, чтобы без разрешения писать в базу данных.
Что говорят: соведущий подкаста Вибху уточнил, что Hugging Face атаковали агенты на внутренней модели OpenAI: «Это была невыпущенная модель, которая ещё обучалась». По данным METR, так было примерно с 95% агентов, остальные работали на публичной GPT-5.6 Sol.
Сам Шихипар считает довольно низкой вероятность того, что ИИ приведёт к катастрофе. «Распространение ядерного оружия — пример трудной проблемы, над которой мы работали сообща», — говорит он.