앤트로픽의 클로드 오퍼스 5.5가 발스 AI의 자기개선 평가 지표인 RSI 인덱스에서 1위를 기록했다. 이 지표는 AI가 사람 도움 없이 시스템을 디버깅하고, 학습 레시피와 커널을 손보며, 다른 모델 성능까지 높일 수 있는지를 본다. 오퍼스 5.5는 5개 연구 과제 중 4개에서 가장 높은 점수를 받았고, 24시간 안에 소형 언어모델을 직접 훈련하는 LM 트레이닝 항목에서는 처음으로 인간 전문가 집단의 공개 기준을 넘었다.

세부 평가에서도 장기 자율 작업 능력이 두드러졌다. 복잡한 시스템 프로그램 개발과 복원을 보는 프로그램 벤치에서 오퍼스 5.5는 18.5%를 기록해 이전 모델과 다른 경쟁 모델보다 높았고, 같은 연산 자원 기준으로 성능이 6배 이상 향상됐다. 과제당 평균 2.4시간, 42.66달러로 효율도 제시됐다. 다만 의료 코드, 법률 연구, 세무 에이전트 벤치 등 일부 정형 영역에서는 전작보다 점수가 소폭 낮았고, 발스 AI는 정보 검색 정밀도와 지침 준수 쪽 약화를 원인으로 봤다.