에포크 AI는 18일(현지시간) 주요 벤치마크를 체계적으로 점검하는 '벤치마크 리뷰(Benchmark Reviews)'를 시작한다고 밝혔다. AI 모델의 성능 비교에 널리 쓰이는 벤치마크가 실제로 얼마나 믿을 수 있는지 먼저 확인하겠다는 취지다. 초기 검토에서는 15개 벤치마크 가운데 4개를 '검증(Verified)', 9개를 '결함(Flawed)', 2개를 '정보 부족(Not enough information)'으로 분류했다.

검토 과정에서 에포크 AI는 잘못된 정답, 오류가 있는 채점 방식, 버전 변화에 따른 평가 기준 불일치 같은 문제를 지적했다. 예를 들어 버클리 함수 호출 리더보드에서는 도구를 써야 하는 문제인데도, 정답표가 도구 사용을 거부한 답변에 점수를 주는 오류가 있었다. '인류의 마지막 시험(HLE)'에서도 문제 설명과 등록된 정답이 맞지 않는 사례가 발견됐다.

이 작업이 중요한 이유는 벤치마크 자체에 오류가 있으면 모델의 실제 성능과 표면적인 점수 사이에 차이가 생기기 때문이다. 그러면 해당 벤치마크를 바탕으로 만든 리더보드와 모델 간 비교 결과의 신뢰성도 함께 흔들릴 수 있다. 에포크 AI는 평가 과제와 채점 기준의 명확성, 채점 방식의 작동 여부, 버전별 비교의 일관성을 기준으로 검토한다고 설명했다.

에포크 AI는 모든 벤치마크를 문제 있다고 본 것은 아니라고 밝혔다. '심플QA 베리파이드'와 '위어드ML v2'를 포함한 4개 벤치마크는 치명적인 오류 없이 검증 기준을 충족했다. 다만 답안 유출 가능성이나 평가 범위 제한 같은 구조적 한계는 남아 있다고 평가했다. 이번 프로젝트는 AI 모델의 점수만 보는 것이 아니라, 그 점수를 만드는 시험지 자체도 함께 검증해야 한다는 문제를 드러낸다.