Claude Fable 5.1 побила рекорд точности в расчёте реакций частиц. Но в упрощённой теории
Модель несколько дней почти без присмотра работала в Claude Science — платформе Anthropic для учёных. Каждый из двух способов расчёта обошёлся бы пользователю в $1–2 тыс., результат проверил физик Лэнс Диксон.

Физики Anthropic поручили модели Claude Fable 5.1 задачу, которую бывший физик-теоретик и научный журналист Мэтт фон Хиппель выставил как вызов ИИ-компаниям. Модель рассчитала амплитуду рассеяния шести частиц на девяти петлях в упрощённой теории, на которой физики обкатывают методы расчёта. Об этом Anthropic сообщила в соцсети X под заголовком «Да, Claude умеет девять петель». Эксперимент описал сам фон Хиппель в гостевой колонке в научном блоге компании.
«Если ИИ-компании хотят впечатлить людей вроде меня (или напугать, если на то пошло), им нужно взяться за мою бывшую область», — написал фон Хиппель в своём блоге 4gravitons. Условие было такое: решить одну из крупных открытых задач с теми вычислительными ресурсами, которые доступны обычному учёному.
Амплитуда рассеяния — формула, по которой физики вычисляют, с какой вероятностью частицы вступят в ту или иную реакцию. Её считают приближённо, до заданного числа «петель»: каждая новая петля учитывает более сложные взаимодействия, делает ответ точнее и требует экспоненциально больше вычислений. Большинство амплитуд посчитаны до двух петель, немногие — до трёх. Задача касалась N=4 суперсимметричной теории Янга — Миллса1: реальный мир она не описывает, зато считать в ней проще.
Физики Anthropic Лиам Фицпатрик и Сиддхарт Мишра-Шарма сначала спросили модель, какую из задач фон Хиппеля она скорее осилит. Затем они дали ей запрос из одной фразы — вычислить шестичастичную амплитуду в этой теории на девяти петлях — и лишь просили не останавливаться. Один из них, например, написал модели: «Я иду спать и несколько часов буду недоступен. Продолжай работать, пока я не скажу остановиться». Модель работала в Claude Science — платной платформе Anthropic для учёных, которая запускает Claude по заданным правилам и инструкциям.
Модель посчитала ответ двумя способами. Первый — бутстрап: известно, как примерно должен выглядеть ответ, и из всех возможных вариантов отбрасывают те, что не проходят проверки; фон Хиппель сравнивает это с судоку. Второй — окольный путь через родственную и более простую формулу, форм-фактор, которым в своё время получили ответ на восьми петлях. Каждый способ обошёлся бы пользователю в $1–2 тыс., в основном за долгую работу Claude, а сами вычисления бутстрапа на Python стоили около $100 — это неделя работы 96 процессоров.
Результат независимо проверил Лэнс Диксон из лаборатории SLAC2, который вместе с соавторами поставил прежний рекорд в восемь петель. Выяснилось, что люди тоже были близко: группа Хэ Суна (Song He) из Китайской академии наук в Пекине уже получила большую часть ответа. Она пользовалась помощью ИИ на основе GPT-6, но не отдавала ему всю работу, как в Anthropic. Публиковать и разбирать результат будут Диксон, Хэ и их соавторы.
Фон Хиппель надеялся увидеть, как ИИ неожиданным способом обойдёт вычислительный предел, но модель применила известные методы и лишь чуть больше мощностей, чем раньше пробовали люди. По его словам, главный вывод в том, что лёгких целей больше, чем кажется: даже чётко поставленная задача порой представляется экспертам куда менее достижимой, чем на деле. Зато модель довела капризный расчёт до конца, не получая указаний сложнее «продолжай». «Если бы я неделю считал такое на 96 процессорах, почти наверняка ушло бы две: с первой попытки я бы что-нибудь да испортил», — признал он.
Ранее, 23 сентября, Anthropic рассказала, как около 950 агентов Claude за 21 час нашли новую систему ферментов, похожую на CRISPR. А 31 августа NVIDIA подключила к Claude Science свои биомодели BioNeMo.