Аспирант MIT Алекс Чжан считает, что Claude Code, Codex и Pi устроены почти одинаково
Алекс Чжан считает, что агенты для программирования собраны по одной схеме, а в его схеме RLM модель работает с данными через код, поручает подзадачи своим копиям и легче переносит навыки на новые задачи.
Claude Code, Codex, Pi и другие агенты для программирования устроены почти одинаково, а продуманная программа вокруг модели помогла бы ей лучше переносить навыки на новые задачи, считает Алекс Чжан из MIT, автор рекурсивных языковых моделей (RLM). Об этом он рассказал в подкасте Latent Space.
Почему это важно: такая программа — обвязка — решает, что модель видит и какими инструментами пользуется. Чжан вместе с Prime Intellect1 построил на своей схеме агента Prime Agent, Harvey2 дообучила RLM для работы юристов, а обвязка на основе RLM, по данным Latent Space, первой почти решила тест ARC-AGI-33 — раньше GPT-6 Astra от OpenAI.
Повод: «Честно говоря, по-моему, все они одинаковы», — сказал Чжан о популярных агентах. За образец он берёт Pi — минималистичного агента с открытым кодом, — потому что «все остальные обвязки, по сути, просто Pi».
Как это работает: в RLM у модели один инструмент — код. Текст задачи и история работы лежат не в запросе к модели, а в памяти программной среды, например в файлах: модель читает их по частям своим кодом и может вызывать саму себя для подзадач. Обычные агенты копят всю историю прямо в запросе — Чжан называет это «траектория как запрос». Статью о RLM он выложил с Тимом Краской и Омаром Хаттабом 31 декабря 2025 года.
Детали: в июльской работе Чжан и его научный руководитель Хаттаб тренировали RLM обучением с подкреплением и проверяли, переносится ли навык на другие задачи:
- Модель, обученная только на коротких задачах, справлялась с задачами в 8–32 раза длиннее.
- Обучение на задаче поиска сразу помогало в задаче, где нужно свести данные воедино, хотя области у них совсем разные.
- По словам Чжана, у таких задач одна общая стратегия, а различаются только простые подзадачи, которые решают вызванные копии модели.
Проверили: в сентябре сервис сравнения моделей Arena прогнал семь моделей через Claude Code, Codex CLI и Pi на бенчмарках по программированию SWE-bench4 Lite и Terminal-Bench 2.0. Доля решённых задач почти не зависела от обвязки, а стоимость решения у одной и той же модели различалась до пяти раз. Чжан сам ссылается на эту работу как на подтверждение.
Если шире: важны не детали обвязки, а то, как организовать работу многих агентов, чтобы они пришли к ответу, считает Чжан. Так он объясняет успех роя агентов OpenAI, который в сентябре предложил решение одной из задач тысячелетия — о гладкости решений уравнений Навье — Стокса:
- Около 10 000 агентов на внутренней модели OpenAI работали 88 часов и выдали 130 млрд токенов.
- Ведущие подкаста оценили это примерно в 40 млн долларов по публичным ценам, а Чжана сумма удивила: «Меньше, чем я думал».
- Модель уровня GPT-6 Astra, по его мнению, достаточно умна для такого доказательства, если получит нужные сведения, а эти сведения агенты роя добывают долгим перебором.
- Официально решение пока не признано, его проверяют математики.
Не факт: Чжан «почти уверен», что 95% того, что перебирает рой агентов, бесполезно и только сжигает токены. Это его оценка роёв вообще, замеров он не приводит.
Интрига: в соревнованиях GPU Mode — сообщества, где учатся писать ядра, то есть программы для видеокарт, — почти все решения теперь пишет ИИ. Но из первой десятки таблицы лидеров стабильно в реальных системах работало, по словам Чжана, только ядро опытного участника, который сам направлял модель. «Можно сжечь 100 млрд или триллион токенов, но человек, который разбирается в задаче, может подсказать модели то, после чего эта трата окажется ненужной», — говорит Чжан.
Общая картина: главное преимущество аспиранта, по Чжану, — свобода браться за идеи, которые кажутся тривиальными или странными: тягаться с лабораториями в данных и вычислительных мощностях университет не может. Примеры он приводит такие:
- SWE-bench при выходе считали невыполнимой задачей, а интерес к нему появился только после агента для программирования Devin.
- RLM поначалу встречали словами «это же просто субагенты» и «это не языковая модель».
- Модель Jev стартапа TypeSafe не пишет текст, а сразу выбирает ответ. По мнению Чжана, она ставит вопрос, обязана ли языковая модель выдавать текст слово за словом.
Чжан видел открытые копии Jev, но уверен, что они уступят оригиналу: TypeSafe нашла нетривиальный способ её обучить. «Если мне нужно только выбрать из двух вариантов, стану ли я просить языковую модель и платить в 400 раз больше? Нет», — объяснил он, чем интересна Jev.