ИИтак

← Назад

ИИ-модели обошли бухгалтеров в тесте Mercor на закрытие месяца

Claude Opus 5 без ошибок решила бухгалтерские задачи, на которых 12 лицензированных бухгалтеров в среднем набрали около 37%, хотя полтора года назад модели до людей не дотягивали.

Точность бухгалтеров и Claude Изображение: Mercor

Компания Mercor1 дала 12 лицензированным бухгалтерам и моделям ИИ четыре задачи на закрытие месяца. Люди в среднем набрали около 37%, а Claude Opus 5 — 100% во всех 20 попытках.

ИИ и специалисты решали одни и те же рабочие задачи, и новейшие модели оказались точнее и быстрее даже лучшего бухгалтера в исследовании. Ещё полтора года назад лучшие модели не дотягивали даже до среднего результата людей.

все люди в исследовании — лицензированные бухгалтеры (CPA2) со стажем в среднем пять с половиной лет, работали без ИИ. В Mercor их называют младшими бухгалтерами.

  • Задачи — четыре сценария закрытия месяца, то есть сверки и подведения итогов за месяц: найти нужные файлы, сделать расчёты и свести результат.
  • В задачи заложили неочевидные, но реальные для профессии требования, которые зависят друг от друга, поэтому один пропущенный показатель сильно снижал балл.
  • Работу людей и моделей проверяли по одному и тому же списку критериев.

  • Бухгалтеры набирали от 0 до примерно 90%, и на большинство попыток у них уходило от 30 минут до трёх часов.
  • Claude Opus 5 тратила на каждую задачу меньше 10 минут.
  • Каждый выполненный критерий у Claude Opus 5 стоил 0,21 доллара, а у бухгалтера — в 49 раз дороже: 10,35 доллара, если считать по медианной зарплате бухгалтера в США.

от почти нуля до безошибочного решения модели дошли за несколько поколений:

  • GPT-4o, модель 2024 года, набирала почти 0%.
  • OpenAI o3 обошла средний результат бухгалтеров весной 2025 года.
  • GPT-5 набрала около 69%, а открытая Qwen3.5-122B осталась ниже 37%.
  • Новейшие передовые модели набирают 100% или почти 100%.

авторы начинают исследование с парадокса. Баллы моделей в бенчмарках3 за последние годы резко выросли, а в экономической статистике США рост производительности от ИИ почти не виден.

«Сверхинтеллект (ранее известный как ИИ) теперь сдаёт тесты по бухгалтерии на отлично», — написал Илон Маск в соцсети X 2 октября. До этого, 29 сентября, Дональд Трамп подписал указ, по которому ведомства США должны писать «сверхинтеллект» вместо «искусственного интеллекта».

по словам авторов, из результатов не следует, что бухгалтеров можно заменить. Задачи проверяли не всю их работу, а то, в чём модели сильнее всего, — точное следование подробным инструкциям. Общения с клиентами, умения задать нужный вопрос и знания неписаных правил компании в тесте не было.

«Результаты провокационные — настолько, что мы думали их не публиковать, опасаясь неверного толкования. Но мы считаем, что открытость важна, пока люди и институты готовятся к стремительному развитию ИИ», — пишут в Mercor.

← Все новости