Бенчмарк Amazon SOP-Bench: ИИ-агентам мешают лишние инструменты, а новые модели не всегда лучше
Amazon выложила в открытый доступ SOP-Bench — более 2 000 задач по настоящим рабочим регламентам из 12 отраслей. Тесты 11 передовых моделей показали: новые модели не всегда сильнее старых, а лишние инструменты вдвое снижают успех.
Исследователи Amazon опубликовали SOP-Bench — открытый бенчмарк, который проверяет, насколько хорошо ИИ-агенты справляются с настоящими рабочими регламентами компаний. Работу представили на конференции KDD 2026, а сам набор выложили на GitHub и Hugging Face.
Стандартная операционная процедура (SOP) — письменная инструкция, по которой сотрудники одинаково выполняют рутинную работу: регистрируют пациента, решают, считать ли груз опасным, проверяют нового корпоративного клиента банка или удаляют контент. Для агента такие тексты сложнее, чем кажется: в них многое не договорено. Авторы приводят пример из регламента приёма пациентов, где страховку велят проверить дважды и не объясняют зачем. Опытный регистратор знает, что в первый раз сверяются со страховой, а во второй — с собственной системой клиники. Агенту остаётся гадать и выбирать между почти одинаковыми инструментами.
В SOP-Bench 12 областей — от приёма пациентов и классификации опасных грузов до службы поддержки, модерации, финансового контроля и инспекции склада — и больше 2 000 задач. Каждая процедура состоит из четырёх частей: текста регламента, инструментов, которые агент может вызывать, их описаний и тестовых случаев с заранее известными правильными ответами. Результат сверяется с этими ответами, а не с мнением другой модели. Регламенты писали отраслевые эксперты, а рутинную часть — схемы данных, имитации API, код инструментов и наборы обычных, пограничных и заведомо провальных случаев — сгенерировала Claude 3.5 Sonnet v2. Эксперты всё это перепроверили. Закрытых и чувствительных данных, по словам авторов, в наборе нет.
Два нарочито простых агента — один вызывает функции, другой построен на рассуждениях — прогнали на 11 передовых моделях. Самый неожиданный вывод: в агенте с рассуждениями семейство Claude 4.5 набрало меньше, чем более старое Claude 4. Авторы предупреждают, что плановое обновление модели в рабочей среде может незаметно снизить качество.
Второй вывод касается инструментов. В задаче по разметке видео агенту дали либо ровно шесть нужных инструментов, либо те же шесть вперемешку с 20 правдоподобными, но бесполезными. Во втором случае успех упал почти вдвое, хотя всё нужное было под рукой.
Универсального победителя нет: связка модели и агента, лучшая на одной процедуре, на другой часто проваливалась. Сортировку писем по намерению агенты делали правильно примерно в девяти случаях из десяти, разметку объектов на видео с дороги — примерно в одном из четырёх. Агент с рассуждениями в среднем оказался чуть лучше, но выиграл лишь 8 из 13 сравнений и тратил на задачу примерно на треть больше времени. Отдельная загадка: длинный регламент, где почти всё — чтение и лишь пара развилок, дался агентам хуже, чем процедура с множеством решений. Считать причиной именно длину авторы не берутся, ведь процедуры различаются и по числу инструментов.
Практический совет авторов — проверять агента на собственных регламентах, прежде чем доверять ему реальную работу. Бенчмарк устроен так, что компании могут подключить свой агент и добавить свои процедуры. Дальше Amazon планирует выпустить усложнённые версии задач, инструкции с картинками и таблицами, а также вложенные процедуры, где агенту придётся переключаться между контекстами на полпути.