Исследователи Tencent научили ИИ-агента хранить сводку вместо истории поиска
В пяти тестах, где агент ищет в интернете ответы на сложные вопросы, модель IterSynth-8B набрала в среднем 50,7 балла — на 4,2 больше прежнего лидера своего размера. Claude Opus 4.5 прибавила баллов: ей лишь дали инструкции IterSynth, не дообучая.

Исследователи Чжэцзянского университета и Tencent представили IterSynth — новую схему работы ИИ-агентов глубокого поиска, говорится в препринте на arXiv от 24 сентября. Такие агенты разбивают сложный вопрос на части, ищут подтверждения в интернете и собирают из них ответ.
Обычно подобных агентов строят по схеме ReAct: одна модель по очереди рассуждает, обращается к поиску и дописывает результаты в общую историю. Авторы видят в этом два изъяна. Одной модели приходится и планировать поиск, и разбирать найденное, и писать ответ. А история с каждым шагом растёт, и полезные сведения тонут в шуме.
В IterSynth модель чередует две роли. Планировщик решает, каких сведений не хватает и что искать дальше. Синтезатор встраивает найденное в сводку, которая обновляется на каждом круге.
На следующем шаге модель видит только исходный вопрос и текущую сводку, а не всю историю поиска. Обе роли исполняет одна и та же модель, различаются лишь инструкции.
По данным авторов, контекст агента держится в пределах примерно 32 тыс. токенов, у ReAct он разрастается больше чем до 64 тыс. Доля отказов из-за переполнения контекста у ReAct составила 59%, у IterSynth — меньше 5%. Поисковых запросов на один вопрос уходит 8–10 вместо 15 с лишним.
Для обучения с подкреплением1 авторы разработали метод RDPO. Модель получает награду не только за верный итоговый ответ, но и за каждый шаг: его оценивает модель-судья2 по списку критериев. Награду считают отдельно для планировщика и синтезатора, чтобы было видно, какая роль ошиблась. Работа судьи, по подсчёту авторов, добавила к стоимости обучения около $192.
Обученная так модель IterSynth-8B построена на открытой Qwen3-8B от Alibaba. На пяти бенчмарках3 глубокого поиска, включая BrowseComp4 и Xbench-DS, она набрала в среднем 50,7 балла. У лучшего прежнего агента размером до 8 млрд параметров, MiroThinker-v1.0-8B, — 46,5 балла.
Веса модели авторы не выложили: в репозитории Tencent на GitHub есть только код для обучения.
Схему можно применять и без обучения — как шаблон запросов к готовой модели. Claude Opus 4.5 с ней набрала в среднем 66,1 балла против 60,6 в режиме ReAct, DeepSeek-V3.1 — 47,9 против 43,4.