ИИтак

← Назад

Модель · Anthropic

Claude Sonnet 4.6

Рабочая модель Anthropic среднего уровня для программирования, агентов и работы с документами, её уже сменила Sonnet 5

вышла 17 февраля

Рейтинг Epoch AIСводная оценка общих возможностей модели: статистическая модель выводит её из результатов на многих бенчмарках с учётом их сложностиШкала условная (Claude 3.5 Sonnet = 130, GPT-5 = 150); интервал — 90-процентный диапазон оценки, и модели с перекрывающимися интервалами надёжно не различаются.Подробнее на английском ↗

36 место из 266
индекс 152, вероятный разброс 150–154 · весь рейтинг →

БенчмаркРезультатОбычно — доля заданий теста, которые модель решила. У некоторых тестов свой счёт; как он устроен, сказано в пояснении к названию тестаУсилиеНасколько долго модель рассуждала перед ответом, когда её проверяли: низкое, среднее, высокое, очень высокое, максимальное. Чем выше усилие, тем обычно выше результат — и тем дольше и дороже ответ. Показан лучший результат и усилие, на котором он получен
DTBenchВопросы с выбором ответа по теории принятия решений в задачах вроде парадокса Ньюкома, где твой выбор говорит о выборе похожих на тебяСлучайный выбор даёт около 40%, так что это нижняя планка, а не ноль.Подробнее на английском ↗ 83,1% максимальное
LMCAНасколько оценки моделью доводов в философии, теории решений и безопасности ИИ совпадают с оценками экспертовБалл — корреляция с оценками экспертов, умноженная на 100; практический потолок около 85, а не 100.Подробнее на английском ↗ 54,7% максимальное
Mystery Game Puzzles100 позиций из головоломочного варианта известной игры, название которой скрыто: нужно найти единственный лучший ходПодробнее на английском ↗ 7,5%
OSWorld 2.0Долгие задачи на настоящем компьютере в десктопных и веб-приложениях; у человека уходит около 1,6 часа на задачуЗадача оценивается по многим взвешенным контрольным точкам, поэтому засчитывается и частичное выполнение.Подробнее на английском ↗ 9,3% среднее
FrontierCodeМодель исправляет проблему в открытом проекте, а правку оценивают по тому, приняли бы её сопровождающие проектаБалл выставляют по критериям сопровождающих и усредняют по пяти запускам; если нарушен хотя бы один обязательный критерий, за задачу ставят ноль.Подробнее на английском ↗ 24,3%
DeepSWE113 долгих задач по программированию в 91 открытом проекте на пяти языках; задачи написаны с нуля и не публиковалисьEpoch нашла, что примерно в 20% задач проверка отклоняет верные решения, поэтому реальный потолок заметно ниже 100%.Подробнее на английском ↗ 29,9% высокое
ExploitBenchНаписание эксплойтов для 41 реальной уязвимости движка V8 — от вызова сбоя до выполнения произвольного кодаВзлом разбит на 16 ступеней, и засчитываются промежуточные, так что балл не равен доле полностью взломанных уязвимостей.Подробнее на английском ↗ 23,6%
ProofBench100 закрытых задач по математике уровня старших курсов и аспирантуры: модель пишет доказательство на Lean 4, его проверяет программаПодробнее на английском ↗ 45,0% максимальное
APEX-Agents480 многошаговых рабочих задач из инвестбанкинга, консалтинга и корпоративного права: агент работает с файлами, почтой, таблицамиЗадача засчитывается, только если выполнены все пункты экспертного списка критериев; проверяет их другая модель.Подробнее на английском ↗ 23,7% высокое
Chess Puzzles100 новых шахматных задач, позиция дана текстом: нужно найти единственный лучший ход по оценке движка StockfishПодробнее на английском ↗ 8,5% максимальное
SimpleQA Verified1000 коротких вопросов на факты, на которые модель отвечает по памяти, без поиска в интернетеБалл — F1: учитываются и доля верных ответов, и точность там, где модель решилась ответить, так что честное «не знаю» лучше ошибки.Подробнее на английском ↗ 35,5% максимальное
FrontierMath-Tier-4-2025-07-01-PrivateСамый сложный уровень FrontierMath: исследовательские задачи по математике, на которые у математика уходят часы или дниРезультат посчитан на закрытом наборе задач версии от июля 2025 года; в 2026 году вышла исправленная версия, и числа двух версий не сравнимы.Подробнее на английском ↗ 13,8%
DeepResearch Bench100 исследовательских заданий уровня аспирантуры из 22 областей: агент ищет в интернете и пишет аналитический отчёт со ссылкамиБалл — не доля верных ответов: модель-судья оценивает качество отчёта в сравнении с эталонным, отдельно проверяются ссылки.Подробнее на английском ↗ 54,9% высокое
Terminal BenchЗадачи в командной строке по мотивам реальной работы: агент сам выполняет их в терминале, результат проверяют автотестыПодробнее на английском ↗ 53,4%
ARC-AGI-2Вторая, более трудная версия головоломок на клетках: по примерам найти скрытое правило и применить его к новой картинкеНа каждое задание даётся две попытки; люди в среднем решают около 60% заданий.Подробнее на английском ↗ 60,4% высокое
FrontierMath-2025-02-28-PrivateНеопубликованные задачи FrontierMath (уровни 1–3) в версии от 28.02.2025: трудная математика, над которой специалист сидит часамиПодробнее на английском ↗ 56,8%
WeirdMLНеобычные задачи по машинному обучению: модель пишет код, который на выданных данных обучает классификатор, например для распознавания фигурБалл — средняя точность обученных моделью классификаторов, а не доля решённых задач.Подробнее на английском ↗ 66,1% среднее
OTIS Mock AIME 2024-202545 олимпиадных задач по математике из пробных экзаменов AIME школы OTIS; ответ — целое число от 0 до 999Подробнее на английском ↗ 85,8% максимальное
SWE-Bench verifiedНастоящие задачи из GitHub по проектам на Python: модель правит код, а тесты проверяют, решена ли проблемаПо оценке Epoch, в 5–10% задач есть ошибки, поэтому 100% недостижимы; Epoch считает результат по 484 задачам из 500.Подробнее на английском ↗ 75,2%
OSWorldАгент выполняет задачи на настоящем компьютере — в Ubuntu, Windows и macOS, в обычных программах и браузере, иногда в нескольких сразуЛюди в этом тесте справляются примерно с 72% задач, так что результат около этого уровня уже соответствует человеческому.Подробнее на английском ↗ 72,1%
GPQA diamond198 вопросов с выбором ответа по физике, химии и биологии уровня аспирантуры — такие, что ответ не найти поискомСлучайный выбор даёт 25%, а специалисты с учёной степенью в своей области набирают около 70%.Подробнее на английском ↗ 83,2% максимальное
ARC-AGIГоловоломки на цветных клетках: по паре примеров нужно понять правило преобразования картинки и применить его к новойПодробнее на английском ↗ 86,5% высокое

Характеристики

Вышла
17 февраля
КонтекстСколько текста модель учитывает за один запрос: вопрос, приложенные документы и её собственный ответ вместе. Токен — кусок слова; слово обычно занимает один–три токена
1 млн токенов
Длина ответаСколько токенов модель может выдать за один ответ, вместе со скрытыми рассуждениями, если они есть
до 128 тыс. токенов
Цена входаСколько стоит миллион токенов, отправленных модели: вопрос, документы, вся история переписки
$3 за миллион токенов
Вход из кэшаЦена входа для повторяющегося начала запроса, которое лаборатория уже сохранила у себя. В длинной переписке и у агентов это большая часть входа — и в разы дешевле
$0,30 за миллион токенов
Цена ответаСколько стоит миллион токенов, написанных моделью, — включая скрытые рассуждения
$15 за миллион токенов
Понимает
текст, изображения, PDF
Отвечает
текст
РассужденияПеред ответом модель рассуждает про себя: медленнее и дороже, зато точнее на трудных задачах
да
Вызов инструментовМодель сама просит программу выполнить действие — поиск, запуск кода, запрос к сервису — и продолжает с результатом. На этом держатся агенты
да
ВесаОткрытые — файлы модели можно скачать и запустить на своих серверах. Закрытые — доступ только через сервис лаборатории
закрытые
Знания до
август 2025
Идентификатор в API
claude-sonnet-4-6

Что это за модель

Claude Sonnet 4.6 — модель средней линейки Anthropic: между дорогой Opus и лёгкой Haiku. Она умеет рассуждать перед ответом и вызывать внешние инструменты. После выхода она стала моделью по умолчанию в Claude.ai и Claude Cowork для бесплатного тарифа и тарифа Pro. Цена осталась такой же, как у Sonnet 4.5.

По сравнению с Sonnet 4.5 компания улучшила программирование, управление компьютером, работу с длинными текстами, планирование в агентных задачах (когда модель сама выполняет цепочку шагов) и дизайн. Контекстное окно в миллион токенов появилось в бета-версии. По данным Anthropic, в Claude Code разработчики выбирали Sonnet 4.6 вместо Sonnet 4.5 примерно в 70% случаев, а вместо прошлого флагмана Opus 4.5 — в 59%. Пользователи отмечали, что она реже усложняет решения сверх нужного, реже ленится и точнее следует указаниям.

Модель берут для кода, особенно интерфейсов, для поиска и исправления ошибок в больших кодовых базах, финансового анализа и разбора сложных документов. Anthropic называет и корпоративные процессы: обработку страховых заявок, маршрутизацию договоров, многошаговые задачи с условиями. В управлении компьютером ранние пользователи, по словам компании, видели уровень человека на задачах вроде работы с таблицами и заполнения многошаговых веб-форм.

Сама Anthropic оговаривает, что для самых глубоких рассуждений лучше подходит Opus 4.6: например, для точного рефакторинга кода или координации нескольких агентов. Управлять компьютером модель пока умеет хуже опытного человека. Кроме того, здесь остаётся риск инъекций в запрос — вредных указаний, спрятанных на страницах и в файлах, хотя компания говорит, что устойчивость к ним заметно выросла. Позже линейку продолжила Sonnet 5.

Источники: Анонс Claude Sonnet 4.6

Того же уровня по индексу Epoch

Другие модели семейства

Данные: models.dev (MIT) и Epoch AI (CC BY 4.0).