ИИ превосходит лицензированных бухгалтеров по скорости и точности, но по-прежнему не может закрывать бухгалтерские книги без контроля
Модели ИИ выполняют структурированные бухгалтерские задачи быстрее, точнее и значительно дешевле бухгалтеров. Таковы результаты исследования Mercor, в котором 12 лицензированных бухгалтеров со средним опытом работы пять с половиной лет выполняли упрощённые задания из бухгалтерского теста APEX. Восемнадцать месяцев назад лучшие модели всё ещё набирали меньше среднего результата бухгалтеров — около 37 процентов. Сегодня они решают те же задачи практически безошибочно.

Полный бухгалтерский тест APEX значительно масштабнее: он включает 160 задач для 10 смоделированных компаний и разработан более чем 40 специалистами со средним опытом работы 11 лет. В настоящее время лидирует Claude Opus 5.5, выполнивший 61,8 процента критериев оценки, за ним следуют Fable 5.1 с результатом 61,0 процента и GPT-6 Astra с 57,9 процента. Тем не менее Mercor сообщает, что ни одна модель полностью не решила почти 60 процентов задач. Модели ИИ пока не могут закрывать бухгалтерские книги без контроля.
Mercor также признаёт, что задания исследования проверяют именно то, что ИИ умеет лучше всего: поиск деталей и точное следование инструкциям. В исследовании не учитывались важные части работы — например, общение с клиентами, взаимодействие с коллегами и использование контекста, наработанного за годы. Mercor считает, что именно поэтому бухгалтеров нельзя заменить, хотя ожидает значительного роста производительности во всей отрасли.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный годовой отчёт о передовых разработках "AI Radar" шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.