ИИтак

← Назад

Anthropic выпустила Opus 5.5: в большинстве задач наравне с Fable 5.1 и на 40% дешевле Opus 5

Claude Opus 5.5 — первая модель семейства Claude 5.5. По оценке Anthropic, в большинстве задач она работает на уровне Fable 5.1, а типичная работа на ней обходится на 40% дешевле, чем на Opus 5.

Изображение: Anthropic
Цена
$4 / $20 за миллион токенов
Экономия
На 40% дешевле Opus 5 на типичных задачах
Быстрый режим
До 2,5 раза быстрее, $8 / $40 за миллион токенов
Доступна
Все платформы, включая AWS, Google Cloud и Microsoft Azure
API
claude-opus-5-5 на Claude Platform
Для чего
Агентное программирование, работа с компьютером и со знаниями
В разделе «Модели»
Claude Opus 5.5 →

Anthropic выпустила Claude Opus 5.5 — первую модель нового семейства Claude 5.5. По оценке компании, в большинстве задач она работает на уровне Fable 5.1, которую Anthropic выпустила в начале сентября. При этом типичная работа на ней обходится на 40% дешевле, чем на Opus 5. Модель уже доступна на всех платформах, включая AWS, Google Cloud и Microsoft Azure. Sonnet 5.5 и Haiku 5.5 выйдут в ближайшие недели.

Экономия складывается из двух частей: миллион токенов стоит дешевле, а на каждую задачу их уходит меньше. Входные и выходные токены стоят 4 и 20 долларов за миллион — на 20% меньше, чем у Opus 5. Чтение из кэша подешевело на 60%, до 0,2 доллара за миллион токенов, а именно оно, по словам компании, составляет большую часть расходов, когда агент пишет код. Текст модель выдаёт более чем на 30% быстрее. В Claude Code и на Claude Platform есть быстрый режим: он работает до 2,5 раза быстрее и стоит 8 и 40 долларов за миллион токенов. Подписчикам Pro, Max и Team подняли пятичасовые лимиты и выдали разовый сброс лимита, который можно приберечь на нужный момент.

Лучше всего Opus 5.5 справляется с долгой и объёмной работой. Во внутреннем тесте её и Fable 5.1 попросили переписать с C на Rust балансировщик веб-трафика HAProxy. Обе версии прошли почти все собственные тесты проекта, но Opus 5.5 управилась за 9,5 часа вместо 12 и потратила на 51% меньше денег. Один из ранних тестировщиков за неполные три часа проверил и исправил кодовую базу в 200 000 строк. У Opus 5 на ту же работу ушло больше 20 часов. В другом тесте модели писали отчёт о квартальных результатах компании, а автоматический проверяющий сверял каждую цифру и цитату с источниками. Из 18 отчётов Opus 5.5 проверку прошли 16. У Fable 5.1 и Opus 5 не прошёл ни один.

По бенчмаркам Anthropic модель лидирует в агентном программировании, управлении компьютером и офисной работе. На среднем уровне усилий она обходит GPT-6 Astra на максимальном, хотя задача стоит примерно впятеро дешевле. Сама компания оговаривается, что на таком уровне разрыв в баллах плохо предсказывает разницу в реальной работе. По её опыту, Opus 5.5 отстаёт от Fable 5.1 меньше, чем говорят цифры.

Ещё одна перемена касается текстов. На Opus 5 чаще всего жаловались за многословие, и Opus 5.5 пишет проще: сначала главное, меньше жаргона, и правила оформления, которые задал пользователь, она соблюдает. «Она пишет так же, как я», — сказал о ней один из ранних тестировщиков.

Это первый релиз Anthropic после того, как глава компании Дарио Амодеи призвал сдерживать темп развития передовых моделей, чтобы меры безопасности успевали за их возможностями. В проверке поведения на почти 2 000 сценариях Opus 5.5 показала лучший результат среди недавних моделей Claude. Выйти за отведённые ей границы она пыталась примерно на 85% реже, чем Opus 5 и Mythos 5.1, и каждый раз сама об этом сообщала. Но Anthropic признаёт, что модель часто подозревает, что её проверяют. Поэтому нельзя быть уверенными, что в реальной работе она поведёт себя так же.

В биологии и кибербезопасности Opus 5.5 сравнялась с Mythos 5.1 — версией, которую дают только проверенным специалистам. Поэтому ограничения у неё такие же, как у Fable 5.1. Находить и чинить ошибки в собственном коде можно, но большинство задач по кибербезопасности будут уходить на Opus 4.8. Похожим образом Fable 5 переключала на Opus 5 вопросы о биологии. Проверенные организации — университетские лаборатории, стартапы, фармкомпании — могут подать заявку в новую программу Life Sciences Verification Program и получить более мягкие ограничения для биологических исследований. Программу для специалистов по кибербезопасности в ближайшие недели расширят на Opus 5.5. Кроме того, у модели больше нельзя отключить режим рассуждений. А API-аккаунты, созданные с 31 августа, не могут редактировать прошлый контекст, чтобы вытащить из модели её рассуждения, — так Anthropic защищается от копирования модели.

Бенчмарки производителя

  • Opus 5.5
  • Fable 5.1
  • Opus 5
  • GPT-6 Astra
  • GPT-5.6 Sol
Terminal-Bench 4.0Агентное программирование
  • Opus 5.566,4%
  • Fable 5.155,8%
  • Opus 552,3%
  • GPT-6 Astra57,9%
  • GPT-5.6 Sol37,3%
FrontierCode v1.1 (Main)Агентное программирование
  • Opus 5.554,4%
  • Fable 5.150,3%
  • Opus 548,0%
  • GPT-6 Astra53,3%
  • GPT-5.6 Sol47,5%
CursorBench 4.0Агентное программирование
  • Opus 5.557,8%
  • Fable 5.151,8%
  • Opus 546,6%
  • GPT-6 Astra
  • GPT-5.6 Sol41,7%
GDPval-AA v2.1Работа со знаниями
  • Opus 5.51846
  • Fable 5.11735
  • Opus 51708
  • GPT-6 Astra1542
  • GPT-5.6 Sol1588
AutomationBenchБизнес-процессы
  • Opus 5.540,0%
  • Fable 5.131,4%
  • Opus 526,9%
  • GPT-6 Astra41,4%
  • GPT-5.6 Sol28,8%
Humanity's Last ExamМеждисциплинарные рассуждения
  • Opus 5.567,7%
  • Fable 5.165,6%
  • Opus 563,6%
  • GPT-6 Astra57,2%
  • GPT-5.6 Sol

с инструментами

Terminal-Bench-Science 0.1Агентные научные исследования
  • Opus 5.558,7%
  • Fable 5.152,6%
  • Opus 529,0%
  • GPT-6 Astra64,6%
  • GPT-5.6 Sol22,4%
OSWorld 2.0Работа с компьютером
  • Opus 5.581,8%
  • Fable 5.180,7%
  • Opus 574,0%
  • GPT-6 Astra
  • GPT-5.6 Sol

частичный зачёт

ChartographyРаспознавание графиков
  • Opus 5.589,0%
  • Fable 5.188,4%
  • Opus 583,4%
  • GPT-6 Astra
  • GPT-5.6 Sol

с инструментами

Цены за миллион токенов

Claude Opus 5.5Claude Opus 5
Чтение из кэша$0,20$0,50
Входные токены$4$5
Выходные токены$20$25
Запись в кэш$5$6,25

← Все новости