ИИтак

← Назад

Microsoft подняла результат малой модели-агента почти вдвое на копиях почты, банка и Airbnb

Microsoft Research сделала Echoverse — подробные копии почты, банка, сервиса бронирования и других приложений для обучения агентов. Модель на 9 млрд параметров подняла на них средний балл с 36,5 до 67,1%.

Изображение: Microsoft Research

Небольшая открытая модель Qwen3.5-9B после обучения на «мирах» Echoverse от Microsoft Research почти удвоила результат в задачах по управлению браузером: с 36,5 до 67,1%. GPT-5.4 в тех же задачах набирает 80,7%. На копиях почты, банка и в задачах с многоуровневыми фильтрами маленькая модель сравнялась с крупной или обошла её.

Echoverse — это рабочие копии приложений, на которых учатся агенты, управляющие компьютером. Всего миров двенадцать. Десять воспроизводят целые сервисы: почту, календарь, банк, медицинские карты, хостинг кода, форум, бронирование жилья. Два оставшихся отрабатывают отдельные элементы интерфейса, на которых агенты часто спотыкаются: выбор даты в календаре и вложенные фильтры. Каждое приложение работает на своей базе данных. Если отправить письмо, оно появится у получателя, а отменённая встреча исчезнет из обоих календарей. Задачу засчитывают по тому, как изменилась база, а не по скриншоту: «закрыть» заявку на словах не получится.

Главный вывод авторов — глубина копии важнее количества. Они обучили модель на примитивных и подробных версиях сайтов Allrecipes и Hugging Face, а проверили на настоящих сайтах. После примитивных копий результат на Allrecipes упал с 80 до 75%, а на Hugging Face не изменился. После подробных вырос до 85 и 65%. По словам исследователей, в «мелком» мире модель усваивает дурные привычки: ходит по кругу и повторяет бесполезные действия, потому что там за это ничего не бывает.

Сами миры тоже учатся. Когда агент проваливает задачу, команда сначала проверяет, не сломано ли приложение или проверка. В копии Airbnb оказался сломан выбор числа гостей, поэтому часть бронирований было невозможно завершить. После исправлений результат модели на этом мире вырос с 16,2 до 38,5%. Ещё один вывод касается масштаба: на открытых сайтах модель прибавляет, когда растёт разнообразие миров, а не число примеров в одних и тех же.

На открытых сайтах, которых модель не видела, прирост скромнее: в бенчмарке WebVoyager — с 66,5 до 71,5%. Авторы объясняют это тем, что их миры в основном закрытые сервисы со входом по логину, а публичные тесты проверяют совсем другое. Дополнительное обучение с подкреплением на пяти мирах подняло результат на отложенных задачах с 58 до 69%. Microsoft выложила код, данные и проверки для четырёх миров: копий бронирования жилья и хостинга кода, а также миров с календарём и фильтрами.

← Все новости