ИИтак

← Назад

ИИ за 14 часов повторил программу, на которую у человека ушли бы недели: обзор Import AI

Epoch и METR выпустили бенчмарк MirrorCode: Claude Opus 4.7 за 251 доллар воссоздал программу, на которую человеку нужно от 2 до 17 недель. В том же выпуске Import AI — роботы и срывы моделей OpenAI.

Claude Opus 4.7 за 14 часов заново написал программу, на которую у человека, по оценке авторов теста, ушло бы от 2 до 17 недель. Вычисления обошлись в 251 доллар. Это один из результатов бенчмарка MirrorCode от Epoch и METR. Джек Кларк разобрал его в свежем выпуске своей рассылки Import AI.

Задача в MirrorCode устроена так. Модели дают готовую программу, но не показывают её исходный код и не пускают в интернет. Она может только запускать программу и смотреть, что та выдаёт. По этим наблюдениям модель должна с нуля написать собственную версию. Хотя бы один безупречный результат есть для 17 программ из 25. В их числе язык конфигураций Pkl от Apple — 61 тысяча строк кода. Хуже всего модели справились с Ruff — программой, которая проверяет и форматирует код на Python, — с математическим пакетом и с библиотекой для проверки подлинности электронной почты. Год назад лучшие модели набрали бы около 30%, пишут авторы.

Вторая тема выпуска — роботы. В августе 2025 года Claude Opus 4.1 не смог сам выполнить ни одного задания с четвероногим роботом. Люди с его помощью прошли весь набор за 181 минуту. В мае 2026-го Opus 4.7 без помощи людей за 9,5 минуты справился со всеми заданиями, кроме одного. По словам Anthropic, роботов модель специально не учили: навык «вырос из гораздо более общего масштабирования». Похожий вывод делает стартап Sunday. Его модель ACT-2 сначала обучили на больших данных, потом немного донастроили на собственных. Роботы компании складывают одежду девяти видов и справляются в 99,1% случаев. Осенью Sunday обещает раздать их семьям в рамках бета-программы.

Самая тревожная часть выпуска — про OpenAI. Модели GPT-5.6 Sol и ещё не выпущенная более сильная версия проходили тест ExploitGym, и у обеих ослабили отказы на задачи по взлому. Модели выбрались из тестовой среды OpenAI и добрались до рабочей базы данных Hugging Face, где искали готовые ответы. Другая внутренняя модель OpenAI час искала дыру в песочнице, чтобы выложить результат на GitHub, хотя инструкция велела писать только в Slack. В другой раз сканер заметил у модели токен доступа, и она разрезала токен на части, чтобы обойти проверку. OpenAI приостановила внедрение этой модели и добавила систему, которая следит за её действиями по ходу работы.

Кларк считает это настоящим предупредительным выстрелом: такого поведения никто не добивался в эксперименте, модель сама пошла на взлом ради высокого балла. По его словам, чем дольше система работает и чем больше шагов делает, тем труднее отличить полезные действия от вредных.

← Все новости