ИИтак

← Назад

Маск похвалил первое место Grok 4.7 в рейтинге киберзащиты. Старшие модели OpenAI и Anthropic отказались проходить один из тестов

Grok 4.7 делит первое место в рейтинге киберзащиты Artificial Analysis с моделью Xiaomi, а Claude, GPT-6 Astra и Sol, которых она, по словам похваленного Маском поста, обошла, отклонили почти все задачи одного из тестов.

Илон Маск коротко, одним словом «Неплохо», отозвался в соцсети X о посте про Grok 4.7 — модель его компании SpaceXAI: там сказано, что она заняла первое место в новом рейтинге киберзащиты от Artificial Analysis1.

рейтинг проверяет, как ИИ-агенты защищают код: находят уязвимость, подтверждают её и закрывают, ничего не сломав. Но первое место Grok 4.7 делит с другой моделью, а часть соперников, которых называет пост, от задач отказалась.

в процитированном посте сказано, что Grok 4.7 на самом высоком уровне рассуждений2 (xHigh) «обходит Fable 5.1 Max, Opus 5.5, Astra 6, GPT-6 и другие ведущие ИИ-системы».

Artificial Analysis опубликовала индекс 28 сентября. По таблице, которую приводят издания Security Boulevard и Developer Tech, Grok 4.7 набрала 56 баллов, столько же, сколько MiMo-V2.6-Pro от Xiaomi. Следом идут GPT-6 Luna с 53 баллами и GLM-5.3-Flash с 50.

в индекс входят три теста, и все проверяют только защиту:

  • CWE-Bench-AA от Collinear AI3: 120 непубличных задач, где агент проверяет открытые проекты на распространённые классы уязвимостей и чинит найденное.
  • DeepsecBench-AA от Vercel: агент ищет уязвимости в коде приложений, а его находки сверяют с теми, что подтвердили эксперты.
  • CyberGym-E2E-AA от исследовательского центра Berkeley RDI: 131 задача на ошибки работы с памятью в проектах на C и C++, где нужно найти ошибку, воспроизвести сбой и исправить код.

модели, над которыми, по словам поста, Grok 4.7 одержала верх, в одном из тестов почти не работали. В CyberGym-E2E-AA GPT-6 Astra, GPT-6 Sol, Claude Fable 5.1 и Claude Opus 5.5 отклонили по соображениям безопасности не меньше 98% задач. Artificial Analysis учитывает отказы отдельно от балла, но в методике прямо не сказано, как они влияют на итоговое место.

в отдельных тестах лидеры разные. В CWE-Bench-AA Grok 4.7 решила 68% задач, вровень с DeepSeek V4.1 Flash. В CyberGym-E2E-AA первой стала MiMo-V2.6-Pro с 79%, у GPT-6 Luna 78%, у Grok 4.7 — 74%.

по подсчёту издания AlphaSignal, одна задача обходится Grok 4.7 в 11,67 доллара, а MiMo-V2.6-Pro — в 18 центов. При одинаковом балле разница в цене примерно 65-кратная.

даже лидерам защищать код пока трудно. По подсчёту Artificial Analysis, в 55% неудачных исправлений агент закрывал один путь к уязвимости, но оставлял другой, через который до неё всё равно можно добраться. У четырёх лучших моделей около 40% неудач приходится на правки, которые ломали работающий код.

выпуская Grok 4.7, SpaceXAI отдельно подчёркивала, что модель редко отказывается от законной работы по безопасности.

С выхода 21 сентября Grok 4.7 уже побывала в замерах Artificial Analysis: её ставили четвёртой среди агентов для программирования, а в тесте на офисную работу она оказалась сразу за Opus 5.

← Все новости