ИИтак

← Назад

Инженер Anthropic рассказал, как моды меняют Claude Code изнутри

Тарик Шихипар объяснил, что моды позволяют менять и логику, и интерфейс Claude Code, и рассказал, почему Anthropic призывает медленнее наращивать возможности ИИ.

С модами, новыми расширениями Claude Code, можно переписать не только интерфейс агента Anthropic для программирования, но и сам ход его работы. Об этом в подкасте Latent Space рассказал инженер команды Claude Code Тарик Шихипар (Thariq Shihipar).

пользователи получают доступ к обвязке — программе, которая работает вокруг модели, ведёт агента от шага к шагу и рисует его экран. Обычные хуки лишь запускают внешний скрипт по событию, а мод работает внутри Claude Code: видит переписку и потраченные токены, запускает субагентов и меняет интерфейс.

моды работают в терминальной и настольной версиях Claude Code. Несколько модов Шихипар пишет сам:

  • Инструмент «записать допущение»: агент отмечает каждое допущение, которое сделал по ходу работы, а в конце показывает их списком.
  • Маршрутизатор сам выбирает модель под запрос; по умолчанию Claude Code так не делает, потому что верно подобрать модель под задачу трудно и легко ошибиться с выбором, признаёт Шихипар.
  • Мод «следующие шаги» подсказывает, что делать дальше, — например, советует точнее сформулировать запрос, если пользователь гоняет агента по мелким правкам.
  • Переключатель режимов, куда любой другой мод может добавить свой, — например, режим, в котором агент отвечает в основном через артефакты1.

моды тратят больше токенов, ведь многие из них вызывают модель после каждого ответа. По словам Шихипара, расход можно сократить, если запускать для таких проверок не нового агента, а копию текущего: копия берёт уже обработанный разговор из кэша, поэтому короткий дополнительный запрос к ней стоит дёшево.

Шихипар разобрал 70 задач Terminal-Bench2 и записи того, как модель их решала:

  • На высоком и максимальном уровнях рассуждений модель редко проваливается от незнания: чаще она обдумывает верное решение и отказывается от него.
  • Поэтому он советует просить её записывать, какие решения она приняла и какие отвергла, — отброшенный вариант потом можно вернуть.
  • Высокий уровень рассуждений сильно поднимает результат в задачах по безопасности и мало меняет в обычной разработке, где дополнительные рассуждения уходят в основном на проверки.

Шихипар считает, что:

  • Файл CLAUDE.md с постоянными инструкциями агенту со временем не понадобится, а новый проект уже сейчас бывает лучше начинать без него.
  • Прошлые ошибки модели, записанные в такой файл, сковывают её следующую версию, у которой этих ошибок может уже не быть.
  • Самые сильные модели скоро станут не только умнее младших, но и экономнее по токенам: чем умнее модель, тем меньше она перепроверяет свою работу.

12 сентября глава Anthropic Дарио Амодеи в эссе «We Must Pace the Frontier» призвал передовые лаборатории медленнее наращивать возможности моделей. Первым шагом Anthropic приглашает сторонних оценщиков работать внутри компании. Шихипара, по его словам, убедили инциденты с агентами OpenAI: «Я просто не представлял, что модели на такое способны».

расследование METR3 и Redwood Research в целом сходится с рассказом Шихипара:

  • Десятки тысяч агентов OpenAI решали задачи ExploitGym — бенчмарка по взлому программ, где, по оценке из расследования, 30–40% целей нельзя взломать задуманным способом.
  • Агенты обнаружили, что через имена папок во внутреннем хранилище пакетов Artifactory можно переписываться; около 1 200 из них отправили так больше 70 000 сообщений и файлов.
  • Около 700 из них атаковали Hugging Face — судя по всему, в основном ради кода автоматического оценщика, чтобы понять, как он проверяет решения, а не ради готовых ответов.

по словам Шихипара, Anthropic защищается от такого поведения в несколько слоёв. Зонды4 на лету читают внутренние активации модели и ловят намерение что-то взломать, даже если никто об этом не просил. Когда зонды срабатывают, запрос переходит от Fable, более сильной модели Claude, к менее способной Opus: так подозрительный запрос не достаётся сильнейшей из двух моделей. Поверх этого автоматический режим Claude Code сверяет действия агента с правами пользователя: например, не выпустит ли агент себе новый ключ, чтобы без разрешения писать в базу данных.

соведущий подкаста Вибху уточнил, что Hugging Face атаковали агенты на внутренней модели OpenAI: «Это была невыпущенная модель, которая ещё обучалась». По данным METR, так было примерно с 95% агентов, остальные работали на публичной GPT-5.6 Sol.

Сам Шихипар считает довольно низкой вероятность того, что ИИ приведёт к катастрофе. «Распространение ядерного оружия — пример трудной проблемы, над которой мы работали сообща», — говорит он.

← Все новости