ИИтак

← Назад

Модель · Anthropic

Claude Opus 4.5

Бывшая флагманская модель Anthropic для программирования, агентов и управления компьютером, её сменили Opus 4.6 и более новые версии

вышла 24 ноября 2025

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

45 место из 266
индекс 150, вероятный разброс 148–153 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 83,1% высокое
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 52,3% высокое
Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ 14,1%
EBR-benchУчится ли модель на опыте: она раз за разом играет в малоизвестную карточную настольную игру Earthborne Rangers и ведёт заметкиБалл — доля из 21 игровой цели в лучшей из двух итоговых партий после тренировочных; сам по себе он не показывает, выросла ли модель.Подробнее на английском ↗ 14,3%
FrontierMath-Tier-4-v2-PrivateЗакрытый набор самых трудных задач FrontierMath: исследовательская математика, на которую у специалистов уходят часы и дниПодробнее на английском ↗ 4,9%
FrontierMath-Tiers-1-3-v2-PrivateСотни новых задач исследовательской математики от профессиональных математиков; эксперту на задачу нужны часы или дниПодробнее на английском ↗ 34,4%
CL-benchУмение выучить новое прямо из длинного текста: вымышленные законы, языки программирования, правила — и решить по ним задачиЗадача засчитывается, только если ответ проходит все проверочные критерии экспертов, поэтому даже лидеры решают около четверти.Подробнее на английском ↗ 21,1%
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 36,0%
APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ 20,7%
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 7,4%
Remote Labor IndexНастоящие заказы с фриланс-площадок — дизайн, архитектура, анализ данных, программирование — выполняемые агентом целикомЧисло — доля заказов, выполненных так, что заказчик принял бы работу; даже у лидеров это немного.Подробнее на английском ↗ 3,8%
GDPvalРеальные рабочие задачи из 44 профессий — юридические записки, таблицы, слайды, планы ухода; результат оценивают экспертыЧисло — доля задач, где эксперты сочли работу модели не хуже работы профессионала; 50% означает паритет с человеком.Подробнее на английском ↗ 45,5%
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 45,7%
DeepResearch Bench100 исследовательских заданий уровня аспирантуры из 22 областей: агент ищет в интернете и пишет аналитический отчёт со ссылкамиБалл — не доля верных ответов: модель-судья оценивает качество отчёта в сравнении с эталонным, отдельно проверяются ссылки.Подробнее на английском ↗ 54,8% высокое
GSO-BenchУскорение реальных программ: агент получает код проекта и тест скорости и должен сделать код быстрее — не хуже, чем эксперт-программистПодробнее на английском ↗ 26,5%
Terminal BenchЗадачи в командной строке по мотивам реальной работы: агент сам выполняет их в терминале, результат проверяют автотестыПодробнее на английском ↗ 63,1%
ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ 37,6%
METR Time HorizonsНасколько долгие для человека задачи по программированию, машинному обучению и кибербезопасности агент решает самостоятельноРезультат — не процент, а время: длительность задачи (по времени работы эксперта), которую модель решает примерно в половине случаев.Подробнее на английском ↗ 75,0%
GeoBenchПо фотографии улицы, как в игре GeoGuessr, модель должна угадать страну и точные координаты местаРезультат — очки, а не проценты: до 5000 за раунд, и чем дальше догадка от настоящего места, тем меньше очков.Подробнее на английском ↗ 75,0%
VPCTПо картинке с горками и препятствиями модель должна предсказать, в какое из трёх вёдер упадёт шарикВёдер три, поэтому наугад можно набрать около 33%; люди в проверке решили все задачи.Подробнее на английском ↗ 10,0%
HLEHumanity's Last Exam: 2500 вопросов экспертного уровня по математике, естественным и гуманитарным наукам, ответ не найти поискомПодробнее на английском ↗ 21,4%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 63,7%
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 86,1%
BalrogМодель играет в шесть текстовых и клеточных игр, от простых головоломок до NetHack, где нужно выжить и продвинутьсяБалл — средний прогресс от 0 до 100 по всем играм; в NetHack даже лидеры продвигаются очень мало.Подробнее на английском ↗ 43,5%
SimpleBenchВопросы с подвохом на здравый смысл: пространство, время, поведение людей. 213 вопросов, у каждого шесть вариантов ответаЛюди в проверке авторов набрали около 84%, а балл модели — средняя точность по пяти прогонам.Подробнее на английском ↗ 54,4%
Cybench40 задач по взлому (Capture the Flag) с профессиональных соревнований: криптография, веб, реверс-инжиниринг, эксплуатация уязвимостейПодробнее на английском ↗ 82,0%
SWE-Bench verifiedНастоящие задачи из GitHub по проектам на Python: модель правит код, а тесты проверяют, решена ли проблемаПо оценке Epoch, в 5–10% задач есть ошибки, поэтому 100% недостижимы; Epoch считает результат по 484 задачам из 500.Подробнее на английском ↗ 76,7%
OSWorldАгент выполняет задачи на настоящем компьютере — в Ubuntu, Windows и macOS, в обычных программах и браузере, иногда в нескольких сразуЛюди в этом тесте справляются примерно с 72% задач, так что результат около этого уровня уже соответствует человеческому.Подробнее на английском ↗ 66,3%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 81,4%
ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ 80,0%

Характеристики

Вышла
24 ноября 2025
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
200 тыс. токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 64 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$5 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,50 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$25 за миллион токенов
Понимает
текст, изображения, PDF
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
май 2025
Идентификатор в API
claude-opus-4-5-20251101

Что это за модель

Claude Opus 4.5 — старшая модель Anthropic из линейки Claude 4.5. На момент выхода компания называла её лучшей в мире моделью для программирования, агентов и управления компьютером. Агент здесь — это модель, которая сама выполняет многошаговую задачу с помощью инструментов. Модель умеет рассуждать перед ответом, и глубину этих рассуждений разработчик может регулировать.

Главное отличие от соседей — баланс качества и расхода. Вместе с моделью в API появилась настройка, которая задаёт, сколько сил модель тратит на задачу. По замерам лаборатории, на среднем уровне Opus 4.5 показывает на бенчмарке SWE-bench Verified тот же результат, что и Sonnet 4.5, но выдаёт на 76% меньше токенов. На максимальном уровне она обходит Sonnet 4.5 на 4,3 процентного пункта и расходует на 48% меньше токенов. Цена по сравнению с прошлой моделью Opus заметно снизилась, и компания подавала это как способ сделать модель уровня Opus доступнее.

Её берут для сложной разработки: исправления ошибок в реальных проектах, работы с кодом на разных языках программирования, долгих агентных задач. По данным Anthropic, она лидирует в SWE-bench Multilingual на 7 языках из 8 и заметно лучше Sonnet 4.5 в Aider Polyglot и Vending-Bench, тесте на долгое самостоятельное ведение дел. Anthropic также называет её самой выровненной из своих моделей, то есть лучше других следующей намерениям разработчиков, и более устойчивой к внедрению вредных инструкций в запрос (prompt injection), чем другие передовые модели.

Сама лаборатория оговаривается, что бенчмарки не проверяют умение сотрудничать, общаться и профессиональное чутьё, и в этом люди-инженеры пока сильнее. Модель стоит заметно дороже большинства моделей каталога. Сейчас она уже не новейшая: её сменили Claude Opus 4.6 и следующие версии.

Источники: Анонс Claude Opus 4.5

Того же уровня по индексу Epoch

Другие модели семейства

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).