Artificial Analysis посчитала: на максимуме Claude Opus 5.5 дороже Opus 5
На максимальном уровне рассуждений одна задача теста Artificial Analysis обходится Opus 5.5 в $5,98, а Opus 5 — в $5,86. Обещанная Anthropic экономия в 40% относится к среднему уровню.
Независимые тесты Claude Opus 5.5 в целом подтвердили её рост, но экономию нашли не везде. По расчёту Artificial Analysis1, на максимальном уровне рассуждений задача из её индекса Intelligence Index обходится новой модели в $5,98, а Opus 5 — в $5,86. Первые замеры и реакцию разработчиков собрала рассылка AINews издания Latent Space.
Artificial Analysis объяснила, откуда такая цифра. Opus 5.5 тратит заметно больше токенов, и уже из-за этого задача подорожала бы примерно на 80%, до $10,51. Anthropic снизила базовую цену на 20%: с $5 до $4 за миллион входных токенов и с $25 до $20 за миллион выходных. С новой ценой задача стоила бы $8,41. До $5,98 её опускает подешевевшее чтение из кэша — $0,20. Сервис оценки моделей Vals тоже отметил, что Opus 5.5 часто расходует больше токенов, особенно в программировании. Обещанные компанией 40% экономии относятся к среднему уровню рассуждений, который стоит по умолчанию.
Высокий уровень рассуждений не всегда окупается и по качеству. В тесте на агентное программирование сверхвысокий уровень обошёлся в 2,8 раза дороже среднего, а балл оказался на 3,2 пункта ниже. Похожая картина была у Opus 5 в бенчмарке FrontierCode. Он снижает оценку за лишние правки, а на высоких уровнях модели начинают менять больше, чем просили.
В сторонних рейтингах модель поднялась высоко. В CursorBench2 она набрала 57,8% на максимальных настройках и вышла на первое место. В FrontierSWE3 от Proximal у неё 62,3%: это второе место после GPT-6 Astra с 65,5%, но выше Fable 5.1 с 56,3%. В индексе Vals Opus 5.5 тоже первая.
К отчёту Anthropic о модели есть претензии. Автор бенчмарка ProgramBench4 Офир Пресс обратил внимание, что почти 100% решённых задач компания получила на 166 задачах из 200. В эту выборку, по его словам, скорее всего не вошли самые сложные программы, например FFmpeg и компилятор PHP. Кроме того, Anthropic считала среднюю долю пройденных тестов, а ProgramBench засчитывает только полностью выполненные задачи. Частичное решение часто проходит 60–70% тестов.
Opus 5.5 стала первой Opus с защитными мерами уровня Fable 5.1 в темах кибербезопасности, биологии и разработки передовых моделей. Помеченные запросы уходят другой модели. Исследователь Танишк Мэтью Абрахам попал на запасную модель, когда попросил Opus 5.5 вылечить рак. Anthropic сообщила, что работает над тем, чтобы ошибочных срабатываний стало меньше.
Внутри Anthropic модель хвалят без обиняков. «Намного, намного, намного лучше Opus 5. Простите за ту модель», — написал в соцсети X один из сотрудников компании. Исследователь Anthropic по безопасности Сэм Боуман считает, что Opus 5.5 «настолько безопаснее предшественников, что её выпуск, скорее всего, снижает риски рассогласования». Latent Space переводит свою рассылку AINews на Opus 5.5: издание сравнило её тексты с текстами GPT-6 Sol и назвало разницу огромной.
Anthropic выпустила Opus 5.5 22 сентября. Тогда же Саймон Уиллисон рассказал, что на уровне max модель думала почти 20 минут и так и не нарисовала тестовую картинку. Sonnet 5.5 и Haiku 5.5 компания обещает выпустить в ближайшие недели.