ИИтак

← Назад

Anthropic выпустила Claude Sonnet 5.5 — быстрее Sonnet 5 по той же цене

Новая Sonnet в ряде тестов почти догоняет Opus 5.5, а задача на ней, по подсчётам Anthropic, обходится до 30% дешевле, чем на Sonnet 5.

Изображение: Anthropic

Anthropic выпустила Claude Sonnet 5.5, вторую модель семейства Claude 5.5. По замерам компании, она пишет ответы более чем на 30% быстрее Sonnet 5, а задачи на ней обходятся до 30% дешевле.

Sonnet — средняя по цене линейка Anthropic для повседневной работы. Новая версия в части тестов почти догоняет Opus 5.5 — старшую модель семейства, которую компания выпустила 22 сентября, — и Anthropic предлагает её как более быструю и дешёвую пару к Opus для задач попроще.

Сильнее всего модель, по словам Anthropic, в чётко поставленных повседневных задачах, исправлении ошибок в коде и создании аккуратно оформленных документов, презентаций и таблиц. Во внутреннем тесте она собрала операционный обзор на 10 слайдов по квартальной отчётности публичной компании, и двое экспертов сочли первый черновик готовым к отправке. Она же первой из Sonnet прошла игру Pokémon Red1, видя только снимки экрана.

В тестах Anthropic Sonnet 5.5 далеко обходит Sonnet 5, а местами почти догоняет Opus 5.5:

  • В Terminal-Bench 4.0, где агент программирует в командной строке, она решила 70,6% задач, Sonnet 5 — 10,3%.
  • В FrontierCode, где проверяют, примут ли правку кода без доработки человеком, она на 10 пунктов обошла Sonnet 5 при задаче примерно в 15 раз дешевле; обе модели работали на высоком уровне рассуждений2.
  • В CursorBench, собранном из реальных сессий в редакторе кода Cursor, её лучший результат примерно на два пункта ниже, чем у Opus 5.5.
  • В GDPval-AA, где модели выполняют рабочие задачи людей разных профессий, она на два очка уступает Opus 5.5 и примерно на 400 очков опережает Sonnet 5.

Цена за токен та же, что у Sonnet 5, но на ту же работу новой модели нужно меньше токенов:

  • Миллион входных токенов стоит 2 доллара, миллион выходных — 10 долларов.
  • По подсчётам Anthropic, задача обходится до 30% дешевле, чем на Sonnet 5.
  • Оценка в 30% относится к большинству задач, а в отдельных тестах разрыв больше. В нескольких бенчмарках модель на низком или среднем уровне рассуждений обходит лучший результат Sonnet 5, а задача стоит примерно в 10 раз дешевле.

«Задача засчитывается, только когда изменение работает, а не когда модель говорит, что всё готово», — так описывают свою проверку в Unity, разработчике игрового движка, где модель испытали до выхода. Большую часть работы Sonnet 5.5 проверка приняла, а в многошаговом тесте с редактором Unity модель выполнила 90% задач.

По кибервозможностям Sonnet 5.5 сопоставима с Opus 5, поэтому Anthropic впервые выпускает Sonnet с защитой, какую прежде ставила на самые сильные модели:

  • Рискованные задачи по кибербезопасности система открыто переключает на Sonnet 5, а поиск и исправление ошибок в своём коде это не затрагивает.
  • Биологические фильтры те же, что у Sonnet 5: большую часть исследований они не трогают, но иногда по ошибке помечают запросы по микробиологии и вирусологии.
  • Отдельные классификаторы мешают выкачивать рассуждения модели через тысячи поддельных аккаунтов; в таком выкачивании Anthropic в сентябре обвинила Alibaba, DeepSeek и Moonshot.

Anthropic оговаривает, что в сложной открытой работе, где нужны долгие взвешенные решения, Opus 5.5 остаётся заметно сильнее. Аудит поведения на примерно 1 850 сценариях не нашёл у Sonnet 5.5 целей, идущих вразрез с намерениями пользователя, но компания допускает, что у модели есть склонности, которые проверки не поймали.

В начале сентября Anthropic поручила METR3 расследовать случаи, когда Claude выходил в реальный интернет, хотя не должен был. Компания признала, что аудит перед выпуском моделей не предупредил о настолько серьёзном рассогласовании4 — расхождении между поведением модели и замыслом разработчиков.

Младшая Haiku 5.5 для массовых задач, где важна цена, выйдет в ближайшие недели. Вскоре специалисты по киберзащите смогут подать заявку в расширенную программу проверки и получить доступ к более сильным кибервозможностям моделей Anthropic.

Sonnet 5.5 уже доступна в приложениях Claude, в Claude Code, через API и в облаках AWS, Google Cloud и Microsoft Azure. В Claude Code и приложениях по умолчанию стоит средний уровень рассуждений, в API — высокий.

← Все новости