Cohere изучила 696 тысяч инструментов для ИИ-агентов: работу целиком делают лишь 2,6%
Cohere Labs собрала открытый датасет ATE из 696 тысяч инструментов для ИИ-агентов. Настоящую рабочую задачу целиком выполняют лишь 2,6% из них, а для 419 из 923 профессий в США не нашлось ни одного инструмента.
Из почти 700 тысяч опубликованных инструментов для ИИ-агентов лишь 2,6% способны выполнить рабочую задачу от начала до конца. К такому выводу пришли в Cohere Labs, исследовательском подразделении Cohere. Авторы собрали 696 тысяч инструментов с 123 тысяч общедоступных MCP-серверов из семи каталогов и выложили их в открытый датасет Agentic Task Ecosystem (ATE).
Каждый инструмент сопоставили с описанием задачи из американской базы профессий O*NET. Затем языковая модель проверяла, выполняет ли инструмент задачу сам или только помогает человеку. Для 419 из 923 профессий не нашлось вообще ничего. Авторы оговариваются, что видят только публичные каталоги: внутренние корпоративные серверы туда не попадают. Поэтому 2,6% — скорее нижняя граница.
Остальные 98% в основном тоже связаны с привычной работой, только разбитой на куски мельче, чем в базе, или склеенной из нескольких задач сразу. Немалая доля обслуживает самих агентов: помогает им регистрироваться, находить друг друга, вести сеансы. По-настоящему новой работы нашлось мало, около 3% категорий. Почти вся она существует из-за агентов: выбрать синтетический голос, сменить ИИ-персонажа, оценить, можно ли доверять агенту.
Разработчики делают то, что технически получается, а не то, чего хотят работники. Экспертные оценки осуществимости предсказывают, для каких профессий появятся инструменты. Пожелания самих работников о том, что они хотели бы автоматизировать, не предсказывают ничего.
Важнее всего, какую часть работы забирают инструменты. В 178 профессиях исследователи ранжировали задачи от рутинных до самых специализированных. В медицине и программировании агенты берутся за специализированную часть, а людям остаётся рутина. В юридических профессиях, на производстве и в продажах инструменты держатся на рутинной периферии, и сложное ядро остаётся за человеком. Специализированная работа поддаётся автоматизации там, где она и так ведётся через софт, и сопротивляется, если она физическая или связана с людьми.
Датасет измеряет, что построили, а не чем пользуются. Но авторы видят в этом повод для тревоги: новички обычно учатся на рутинных задачах, которые им передают опытные коллеги. Если эти задачи уйдут машинам, открытым останется вопрос, как люди вообще будут становиться экспертами.