ИИтак

← Назад

Microsoft открыла Orchard — общую инфраструктуру для обучения небольших ИИ-агентов

Microsoft Research выложила в открытый доступ фреймворк Orchard для обучения и проверки агентов. Модель Orchard-SWE, у которой активны около 3 млрд параметров, решает 69,7% задач SWE-bench Verified, а с переранжированием ответов — 73%.

Изображение: Microsoft Research

Microsoft Research выложила в открытый доступ Orchard — фреймворк, на котором исследователи могут обучать и проверять ИИ-агентов, не собирая инфраструктуру с нуля. Вместе с ним вышли обучающие данные, методы оценки и три готовых рецепта: для агентов-программистов, браузерных агентов и персональных ассистентов.

Ядро проекта — сервис Orchard Env на Kubernetes. Он параллельно запускает тысячи изолированных «песочниц», где агенты пишут код, ходят по сайтам или разбирают почту. Одна и та же среда годится для сбора данных, обучения с подкреплением и финальной проверки. По словам авторов, сложные агентные системы обычно требуют закрытых песочниц и собственных датасетов, которых у большинства исследователей нет. Ещё одна особенность Orchard: агента можно обучать прямо внутри той обвязки, где он потом будет работать, — Codex, OpenClaw или ZeroClaw. Открытые инструменты обычно учат модель в упрощённой замене, а в реальной обвязке она потом ведёт себя иначе.

Самый заметный результат у Orchard-SWE. Модель обучили на 107 000 решений задач с GitHub, которые сгенерировали MiniMax-M2.5 и Qwen3.5-397B. Неудачные попытки при этом не выбрасывали: модель училась на их удачных фрагментах. После обучения с подкреплением результат на SWE-bench Verified вырос с 61,4% до 69,7%. У модели активны лишь около 3 млрд параметров. Затем добавили небольшую оценочную модель на 4 млрд параметров: она выбирает лучший из нескольких вариантов решения, и так результат дошёл до 73%. Авторы пишут, что это близко к уровню передовых систем, которые больше в десять с лишним раз.

Браузерному агенту Orchard-GUI на 4 млрд параметров хватило 400 примеров и 2 200 открытых задач. В среднем по трём веб-бенчмаркам он набрал 68,4%, в том числе 74,1% на WebVoyager. Ассистента Orchard-Claw обучили всего на 200 синтетических задачах с почтой, календарём и поиском. В обвязке Codex после обучения он справляется с 51,5% задач, а до обучения справлялся с 18,6%.

Дальше авторы хотят накапливать опыт агентов. Попытки, которые остаются после обучения, они предлагают не выбрасывать, а превращать в оценочные модели, чтобы следующее поколение агентов не начинало с нуля.

← Все новости