ИИ-модели обошли бухгалтеров в тесте Mercor на закрытие месяца
Claude Opus 5 без ошибок решила бухгалтерские задачи, на которых 12 лицензированных бухгалтеров в среднем набрали около 37%, хотя полтора года назад модели до людей не дотягивали.

Компания Mercor1 дала 12 лицензированным бухгалтерам и моделям ИИ четыре задачи на закрытие месяца. Люди в среднем набрали около 37%, а Claude Opus 5 — 100% во всех 20 попытках.
Почему это важно: ИИ и специалисты решали одни и те же рабочие задачи, и новейшие модели оказались точнее и быстрее даже лучшего бухгалтера в исследовании. Ещё полтора года назад лучшие модели не дотягивали даже до среднего результата людей.
Детали: все люди в исследовании — лицензированные бухгалтеры (CPA2) со стажем в среднем пять с половиной лет, работали без ИИ. В Mercor их называют младшими бухгалтерами.
- Задачи — четыре сценария закрытия месяца, то есть сверки и подведения итогов за месяц: найти нужные файлы, сделать расчёты и свести результат.
- В задачи заложили неочевидные, но реальные для профессии требования, которые зависят друг от друга, поэтому один пропущенный показатель сильно снижал балл.
- Работу людей и моделей проверяли по одному и тому же списку критериев.
В цифрах:
- Бухгалтеры набирали от 0 до примерно 90%, и на большинство попыток у них уходило от 30 минут до трёх часов.
- Claude Opus 5 тратила на каждую задачу меньше 10 минут.
- Каждый выполненный критерий у Claude Opus 5 стоил 0,21 доллара, а у бухгалтера — в 49 раз дороже: 10,35 доллара, если считать по медианной зарплате бухгалтера в США.
Расклад: от почти нуля до безошибочного решения модели дошли за несколько поколений:
- GPT-4o, модель 2024 года, набирала почти 0%.
- OpenAI o3 обошла средний результат бухгалтеров весной 2025 года.
- GPT-5 набрала около 69%, а открытая Qwen3.5-122B осталась ниже 37%.
- Новейшие передовые модели набирают 100% или почти 100%.
Общая картина: авторы начинают исследование с парадокса. Баллы моделей в бенчмарках3 за последние годы резко выросли, а в экономической статистике США рост производительности от ИИ почти не виден.
Что говорят: «Сверхинтеллект (ранее известный как ИИ) теперь сдаёт тесты по бухгалтерии на отлично», — написал Илон Маск в соцсети X 2 октября. До этого, 29 сентября, Дональд Трамп подписал указ, по которому ведомства США должны писать «сверхинтеллект» вместо «искусственного интеллекта».
Но: по словам авторов, из результатов не следует, что бухгалтеров можно заменить. Задачи проверяли не всю их работу, а то, в чём модели сильнее всего, — точное следование подробным инструкциям. Общения с клиентами, умения задать нужный вопрос и знания неписаных правил компании в тесте не было.
«Результаты провокационные — настолько, что мы думали их не публиковать, опасаясь неверного толкования. Но мы считаем, что открытость важна, пока люди и институты готовятся к стремительному развитию ИИ», — пишут в Mercor.