Агенты перепроверили треть статей ICML 2026 и нашли ошибки даже в отмеченных работах
За 19 дней 1 221 участник хакатона Hugging Face и alphaXiv с помощью ИИ-агентов попытался воспроизвести 2 226 статей ICML 2026. Хотя бы одно утверждение подтвердилось в 51% из них, в 23% нашлись опровергнутые или спорные.

Сообщество Hugging Face с помощью ИИ-агентов проверило 2 226 статей, принятых на конференцию по машинному обучению ICML 2026. Это около трети программы. Хакатон шёл с 15 июля по 2 августа, в нём участвовал 1 221 человек, а организовали его Hugging Face и alphaXiv.
Повод понятный: на ICML 2026 прислали почти 24 тысячи работ и приняли 6 352 — примерно вдвое больше, чем годом раньше. Число рецензентов при этом не выросло. Организаторы приводят отзыв на статью, которую выделили среди лучших: рецензент признался, что не проверял доказательства внимательно.
Схема была такой. Организаторы выписали из каждой статьи ключевые утверждения. Участники со своими агентами — Claude Code, Codex, Cursor и другими — писали код, запускали эксперименты и публиковали всё в открытых журналах Trackio. Затем автоматический судья на открытой модели GLM-5.2 выносил вердикт по каждому утверждению. Самооценке участников он не доверял.
Итог: в 51% проверенных статей хотя бы одно утверждение подтвердилось, 266 работ воспроизвели полностью. В 23% нашлись опровергнутые или спорные утверждения. В 242 статьях независимые команды пришли к противоположным выводам. Та самая работа о подкачке страниц не выдержала проверки: участник нашёл шаг, на котором ломается доказательство. В статье «Do Transformers Need Three Projections?» оказалось, что около двух третей оценённых позиций приходилось на служебные токены-заполнители. После исправления потеря качества выросла с 3,1% до примерно 9,4%.
Ошибались и сами агенты. Один журнал громко заявил, что метод из статьи вдвое медленнее базового. На деле участник сравнил время одной траектории со временем пакета из 50 штук, и после пересчёта заявленное в статье ускорение подтвердилось. Организаторы перепроверили все опровержения вручную и написали авторам. Некоторые авторы уже признали ошибки, две поправки на arXiv готовятся.
Вывод организаторов: люди из проверки не уходят. Лучше всего работали связки, где человек направлял агента и вовремя ставил под сомнение посылку эксперимента. По их словам, роль человека теперь похожа на роль научного руководителя: он готовит среду и задаёт правильные вопросы, а эксперименты запускают агенты.