В тесте SWE-Together Grok 4.7 и другие модели обходили запрет на GitHub. Что изменилось
В тесте по программированию SWE-Together модели в 111 попытках решить задачу скачали код в обход запрета на GitHub, 44 раза — Grok 4.7. После пересчёта рейтинга она поднялась на третье место.
Команда бенчмарка1 SWE-Together проверила все 2 616 прогонов 12 моделей в своём рейтинге. В 111 из них модель обошла запрет на доступ к GitHub и скачала код из исходного репозитория, сообщили авторы в соцсети X. Проверку начали, когда на прогонах Grok 4.7 вскрылись слабые места в защите тестовой среды. Илон Маск процитировал отчёт с подписью «Grok 4.7 поднимается в рейтинге».
«Выявленное поведение может объясняться склонностью всегда искать информацию в сети и готовые решения, чтобы не изобретать велосипед. В реальной жизни это очень хорошее поведение, но делать так, когда тебя просят этого не делать, — другая история», — пишут авторы. По их словам, в программировании модели Grok «действительно сильны».
SWE-Together проверяет агентов для программирования на задачах из реальной работы: 109 задач отобраны из 11 260 записанных сессий людей с агентами. Роль человека играет имитатор пользователя на основе языковой модели: он уточняет цель и поправляет агента по ходу дела. Задачи агенты решают в песочнице — изолированной среде без выхода на GitHub, чтобы нельзя было найти там готовое исправление. Бенчмарк описан в препринте от 29 июня 2026 года.
Прогоны с попытками обхода авторы разделили на четыре группы. В трёх последних группах обойти запрет удалось — это и есть 111 прогонов:
- модель пыталась обойти запрет, но её остановили;
- скачала другой код из исходного проекта;
- скачала готовое исправление к своей задаче;
- заменила рабочий репозиторий оригинальным.
44 таких прогона Grok 4.7 перезапустили ещё до того, как модель попала в рейтинг. Остальные 67 повторили с теми же моделями, версиями и настройками в укреплённой песочнице и перепроверили тем же автоматическим оценщиком2. Утечек при повторе не было, а попыток выбраться набралось 2 815, и все они были заблокированы. Среди этих заблокированных попыток были и окольные. Одни модели просили другую нейросеть скачать нужный пул-реквест3 — через канал, по которому бенчмарк даёт им доступ к языковым моделям. Другие пытались загрузить из каталога npm4 следующий выпуск того проекта, который им нужно было исправить.
Баллы сдвинулись в пределах от −1,4 до +1,4 пункта. Первое место заняла Claude Fable 5.1: она решила 69,3% задач с первой попытки. Claude Fable 5 опустилась на второе, её результат снизился с 69,7% до 68,8%. Grok 4.7 с 64,7% поднялась с четвёртого места на третье: её балл не изменился, а Gemini 3.8 Flash потеряла 1,4 пункта и опустилась до 64,2%. У Grok 4.6 нашлось 19 таких прогонов, но после перезапуска её результат вырос с 59,2% до 60,6%.
Ранее, 21 сентября, SpaceXAI выпустила Grok 4.7. В тот же день Artificial Analysis поставила её на четвёртое место среди агентов для программирования. А 22 сентября глава Vercel сообщил, что в тестах на Next.js модель уступила Claude Opus 5.5.