Artificial Analysis는 사전 공개 버전의 Claude Sonnet 5.5를 평가해, 최대 effort 설정에서 Sonnet 5보다 18점 높은 성능을 기록했고 Intelligence Index 2위에 올랐다고 밝혔다. 순위는 Opus 5.5(max) 다음이다. 가격은 Sonnet 5와 같은 1M 캐시 입력·입력·출력 토큰당 $0.2/$2/$10으로 제시됐지만, 작업당 출력 토큰 수가 더 많아 Cost per Task는 $7.60으로 집계됐다. 이는 Sonnet 5보다 약 50% 높다.
세부 평가에서는 Terminal-Bench 4.0에서 64%로 Opus 5.5와 GPT-6 Astra의 60%를 넘었고, AA-Briefcase, GDPval-AA, AutomationBench-AA에서는 Opus 5.5와 비슷한 수준을 보였다. 다만 최대 설정에서 Intelligence Index 작업당 약 193k 출력 토큰을 사용해 측정 모델 중 가장 무거운 토큰 사용량을 기록했다. 이는 Opus 5.5(max)나 Sonnet 5(max)보다 약 60% 높고 GPT-6 Astra(max)의 약 7배다. 사실 지식과 과학 추론에서는 Opus 5.5보다 낮았으며, 구조화된 출력 요청의 응답을 떨어뜨리는 버그가 사전 공개판에 있었고 공개판에서는 수정됐다고 밝혔다.
