Что изменилось по сравнению с Opus 4.8
Opus 5 сделана для сложного агентного программирования — когда модель сама работает с файлами и инструментами; запросы под Opus 4.8 работают на ней без переделки, а лучше всего она справляется, получив полное описание задачи сразу. Инструкцию «сообщай только серьёзные проблемы» при проверке кода она выполняет буквально и находит меньше, так что просите всё, а отсеивайте отдельным проходом. Уровни усилия low и medium (effort — параметр, который задаёт, сколько модель думает перед ответом) стали главным рычагом цены и скорости: начинайте с high по умолчанию, спускайтесь ниже, где качество держится, и поднимайтесь до xhigh для трудного кода. Контекстное окно — объём текста, который модель держит перед глазами, — 1 млн токенов, по умолчанию и по максимуму.
Длина ответов и рассказ о ходе дела
Ответы у Opus 5 по умолчанию длиннее, чем у прежних Opus, и effort тут не помощник: он управляет тем, сколько модель думает, а не сколько говорит. Краткость задают отдельной инструкцией, а в длинном системном запросе повторяют её коротким напоминанием ближе к концу. В агентной работе модель охотно объявляет, что собирается делать; если это лишнее, опишите нужный ритм сообщений — когда писать и с чего начинать итог. Если отчётов хочется больше, покажите примеры: они работают лучше запретов. Файлы, которые модель пишет на диск, — отчёты, сводки — тоже выходят длиннее; для них нужна отдельная инструкция про объём.
Лишние проверки, границы задачи и подагенты
Opus 5 проверяет себя и чинит свои ошибки без напоминаний. Инструкции «добавь финальную проверку» и «перепроверь ответ» уберите вместе со старыми обвязками, где проверка стоит отдельным шагом: они удваивают проверку, тратят токены и не улучшают результат. Свои оговорки она исправляет вслух чаще, чем раньше; в продукте для пользователей попросите озвучивать только то, что меняет код, выводы или решения.
Границы задачи задайте прямо: модель склонна добавлять шаги, которых не просили. Подагентам — отдельным экземплярам модели, которым основная поручает часть работы, — она делегирует охотнее прежних версий. На больших независимых кусках работы это окупается, на мелких умножает цену и время, поэтому в запросе нужно правило, когда делегировать, а лучше — жёсткие лимиты. В Claude Code и Claude Agent SDK их задают переменные окружения CLAUDE_CODE_MAX_SUBAGENT_SPAWN_DEPTH и CLAUDE_CODE_MAX_CONCURRENT_SUBAGENTS и параметр max_budget_usd; нужна версия Claude Code не ниже 2.1.217. Своё правило о делегировании Claude Code добавляет только с готовым системным запросом claude_code; со своим запросом пишите его сами.
Выключенное мышление
Мышление у Opus 5 включено по умолчанию; выключить его можно только при уровне усилия high и ниже, а с xhigh или max запрос вернёт ошибку 400. Без мышления изредка вылезают два дефекта: вызов инструмента попадает в текст ответа и не выполняется, а его текст остаётся в истории и портит следующие ходы; в видимый ответ просачиваются служебные теги, и правило «не думай» в системном запросе только усиливает утечку. Anthropic советует не выключать мышление, а снижать effort: на большинстве задач мышление на уровне low работает лучше, чем выключенное при похожей цене. Если выключать всё же нужно, помогает одна общая инструкция: разрешить модели фразу перед вызовом инструмента, велеть признаться, если подходящего нет, и запретить служебные теги — не называя их поимённо.