ИИтак

← Назад

Alibaba представила Qwen Intelligence — трёх ИИ-агентов для смартфонов. Как это работает

Один агент раскладывает просьбу на шаги, второй нажимает кнопки в приложениях, третий рисует картинку за 3 секунды. Alibaba также выложила в открытый доступ четыре набора тестов, по которым можно сравнивать ИИ-агентов для смартфонов.

Alibaba представила Qwen Intelligence — набор из трёх ИИ-агентов1, которые выполняют задачи на смартфоне за пользователя. О запуске команда Qwen сообщила в соцсети X и пообещала сделать «персональный интеллект» доступным каждому.

Платформа Qwen Intelligence рассчитана на производителей смартфонов. Они могут встроить в свои телефоны весь набор или только отдельных агентов.

Первый агент, Mobile Planner Agent, составляет план. Он разбивает сложную просьбу на шаги и раздаёт их инструментам и другим агентам. Условия из прошлых реплик он держит в памяти. Если инструмент вернул ошибку, агент меняет подход.

В основе агента — модель-планировщик Qwen-Planner-Agent на 27 млрд параметров. По данным технического отчёта, в общем зачёте бенчмарка2 MobilePA-Bench она набрала 77,05%. Это на 9,83 процентного пункта больше, чем у её базовой версии. Выходные токены3 обходятся примерно в $2,41 на 1 000 задач, но входные токены и работа инструментов в эту оценку не входят.

Второй агент, Mobile-Use Agent, действует в приложениях. Сначала он пробует обойтись программным интерфейсом приложения (API), а если это не выходит, управляет экраном, как человек. В примере Alibaba агент находит в Douyin, китайской версии TikTok, рецепт говядины в кислом супе с маракуйей, который чаще всего сохраняли в закладки. Затем в приложении Hema, сети продуктовых супермаркетов Alibaba, он заказывает все ингредиенты, кроме приправ, и ставит доставку на 18:45.

По данным Alibaba, в бенчмарке MobileWorld этот агент успешно выполнил 82,1% заданий. В MobileWorld-Real, где задачи выполняются на настоящих телефонах, он справился с 92,2% заданий. От начала до конца агент доводит 90% задач.

Третий агент, Mobile Creative Agent, превращает одну фразу в готовую картинку. Изображение появляется за 3 секунды. По оценке Alibaba, это примерно вдвое быстрее, чем у ведущих конкурентов. Каких именно, компания не уточнила.

Вместе с агентами Alibaba открыла четыре бенчмарка. MobilePA-Bench проверяет планирование, MobileWorld — работу сразу в нескольких приложениях, MobileWorld-Real — работу на реальных устройствах, MobileWorld-Safety — безопасность. Для них запущена публичная таблица результатов.

Сами модели Alibaba не выкладывает. В репозитории планировщика на GitHub лежат только технический отчёт и записи примеров, весов и кода там нет.

← Все новости