ИИтак

← Назад

IBM научила ИИ-агентов учиться на своих ошибках и тратить в разы меньше токенов, чем ACE

По данным IBM Research, её библиотека ALTK-Evolve на бенчмарке AppWorld решает задачи не хуже конкурирующего метода ACE. При этом на сильной модели она обходится примерно в 40% его стоимости, а на слабой — в седьмую часть.

Изображение: Hugging Face

IBM Research сравнила свою систему памяти для ИИ-агентов ALTK-Evolve с методом ACE. Обе системы делают одно и то же: превращают прошлые попытки агента в уроки и подсказывают их модели в следующих задачах. Модель при этом не переобучают, а люди ничего не размечают. По данным IBM, её вариант решает задачи так же или лучше и тратит в разы меньше токенов.

Авторы исходят из того, что агент в многошаговых задачах обычно ошибается не от незнания. Он неправильно листает страницы выдачи API, находит не того человека или возвращает значение, которое никто не просил. Как работать с инструментами надёжно, агент может выучить из собственной истории.

В одном системы сходятся. Уроки не стоит сжимать в короткую сводку: так теряются детали. ACE хранит подробную «инструкцию» и отмечает у каждого пункта, помогал он или вредил. ALTK-Evolve хранит отдельные правила и для каждого считает, в скольких независимых эпизодах оно возникло. Похожие правила система объединяет, а их счётчики складывает.

Главное различие — в том, что доходит до модели. ACE на каждом шаге отправляет ей всю инструкцию целиком. ALTK-Evolve всегда передаёт небольшое ядро самых подтверждённых правил, а к нему добавляет несколько правил, подобранных под конкретную задачу. Если модель способна переварить больше, ей можно отдать и весь набор.

Системы проверили на бенчмарке AppWorld: 168 задач в девяти имитированных приложениях. С DeepSeek-V3.2 ALTK-Evolve обошла ACE по обоим показателям и обошлась примерно в 40% стоимости работы ACE. С более слабой gpt-oss-120b она набрала 56,0 против 54,8. Сами авторы называют это ничьей, потому что при повторном запуске вышло те же 54,8. Зато стоило это примерно в семь раз дешевле. По словам IBM, на слабой модели ACE лучше справляется с лёгкими и средними задачами, а выборочная подача правил выигрывает на сложных.

Есть оговорка: цифры по ACE получены в собственных запусках IBM. Авторы объясняют это тем, что в статье об ACE использовалась другая модель, DeepSeek-V3.1. Кроме того, у двух агентов различаются шаблоны запросов, поэтому даже без памяти они стартуют с разного уровня. Библиотека ALTK-Evolve выложена в открытый доступ вместе с техническим отчётом.

← Все новости