IBM: память ИИ-агента нужно дозировать, иначе слабую модель она только топит
IBM Research проверила библиотеку ALTK-Evolve на восьми моделях. Сильным моделям лучше давать весь набор выученных правил, слабым — компактный набор под задачу, а некоторым память не помогает вовсе.

Если дать ИИ-агенту всё, чему он научился на прошлых задачах, он не обязательно станет работать лучше. Такой вывод сделали в IBM Research, когда проверили свою библиотеку ALTK-Evolve на восьми моделях: от плотной модели на 30 млрд параметров до передовых коммерческих систем. Исследователи формулируют это так: память агента — не функция, которую включают, а доза, которую подбирают под модель.
ALTK-Evolve разбирает прошлые попытки агента, удачные и неудачные. Из них она выводит правила: какие стратегии сработали, каких ошибок избегать, какие бывают редкие случаи. При следующих задачах агент получает эти правила в запросе. Саму модель при этом не переобучают, а людям не нужно ничего размечать.
Проверяли на бенчмарке AppWorld: 585 многошаговых задач в девяти имитациях приложений вроде календаря, мессенджера и платёжного сервиса. Модели разделились на три группы. Сильным моделям с запасом роста подходит полный набор правил: у DeepSeek-V3.2 доля решённых задач выросла на 9,5 процентного пункта. Слабые модели в большом наборе тонут. gpt-oss-120b лучше всего справилась, когда получала небольшое ядро самых надёжных правил и несколько правил, подобранных под конкретную задачу. Так она прибавила 16,1 пункта, а расход токенов вырос всего на 5%. Полный набор дал ей меньший прирост и обошёлся примерно на 50% дороже. У GLM-5 заметного эффекта не было вовсе.
Авторы подчёркивают, что группу модели определяет не только её размер. Играют роль запас до потолка бенчмарка, размер контекстного окна, архитектура, качество правил и сами задачи. Разделить эти факторы исследователи пока не успели.
По более строгому показателю, где засчитываются только сценарии, пройденные во всех вариантах, эффект обычно сильнее. У DeepSeek он вырос на 16,1 пункта. Даже GPT-5.5 и Opus, которые почти упираются в потолок, прибавили около 7 пунктов. Дорогой полный набор правил в рабочей среде, по словам авторов, удешевляет кэширование промптов: неизменную часть не нужно каждый раз обрабатывать заново.
Неделей раньше IBM сравнивала ALTK-Evolve с методом ACE и показала, что способ подачи правил влияет и на точность, и на цену. Главное ограничение нового исследования — все результаты получены на одном бенчмарке. Проверки на других наборах задач и в реальной работе, по словам IBM, ещё идут.