데이터 분석 전문 머코어는 실제와 유사한 회계 업무 벤치마크에서 앤트로픽의 '클로드 오퍼스 5'가 100%에 가까운 정확도를 기록했다고 밝혔다. 비교 대상은 공인회계사 자격을 갖고 평균 5년 반 경력을 지닌 회계사 12명이었다. 이들은 월말 결산 시나리오를 바탕으로 수치 탐색, 계산, 결과표 작성처럼 세부 지시를 정확히 따라야 하는 과제를 수행했고, 평균 정확도는 37%였다. 회계사들은 과제 완료에 30분에서 최대 180분이 걸렸지만, 첨단 모델은 10분 이내에 끝냈다.
비용도 차이가 컸다. 평가 기준 충족당 AI는 0.21달러, 회계사는 미국 평균 임금 기준 10.35달러가 들었다. 기사에 따르면 18개월 전만 해도 최상위 모델은 회계사 평균에도 못 미쳤고, 2024년 5월 'GPT-4o'는 거의 0점 수준이었지만 2025년 5월 'o3'가 이를 넘어섰다. 다만 연구진은 이번 실험이 단일 수치 누락에도 감점이 누적되는 격리 환경이어서 인간에게 불리했다고 설명했다. 고객 소통이나 맥락 파악 같은 비구조화 업무는 빠졌고, 오픈소스·저예산 모델은 여전히 회계사 평균 아래에 머물렀다.
