스탠퍼드대학교와 엔비디아 연구진은 23일(현지시간) AI 에이전트의 제한된 의사결정을 빠르게 처리하는 오픈소스 모델 'CLM-8B(Contrastive Language Models)'를 공개했다. 이 모델은 최근 주목받은 제브처럼 새 문장을 생성하는 대신, 현재 상태와 가능한 행동을 비교해 가장 적합한 선택을 고르는 방식에 집중한다. 연구진은 이를 통해 도구 선택과 결과 검증 같은 반복적인 판단 작업을 별도 모델로 분리해 속도를 높이려 했다.
CLM은 현재 작업 상태와 선택 가능한 행동을 같은 임베딩 공간에 놓고, 정답 조합은 가깝게, 잘못된 조합은 멀어지게 학습한다. 실제 실행 때는 현재 상태만 새로 인코딩하고, 미리 계산해 둔 행동 표현과 비교해 행동을 고른다. 같은 행동을 여러 번 재사용하는 에이전트에서 특히 유용한 구조다. 예를 들어 기업용 IT 에이전트가 비밀번호 재설정, 접근 권한 부여, 티켓 생성처럼 승인된 작업 중 하나를 골라야 할 때, 매번 모든 행동을 프롬프트로 처리하지 않아도 된다.
성능 비교에서는 속도 이점이 두드러졌다. 구글의 공룡 점프 게임을 활용한 제로샷 테스트에서 CLM-8B의 평균 지연시간은 16ms로, 제브의 150ms보다 9배 빨랐다. 게임 과제에서는 제브와 같은 성공률을 기록했다. 다만 정확도는 더 낮았다. BFCL v4 도구 호출 벤치마크에서는 CLM-8B가 95.2%, 제브가 99.2%였고, 위키레이싱 과제에서도 CLM-8B는 30개 중 26개를 해결해 30개 전부를 해결한 제브에 못 미쳤다.
연구진은 CLM-8B를 범용 추론 모델의 대체재가 아니라, 생성 모델이 만든 후보를 빠르게 선택하고 검증하는 계층으로 제시했다. 실제로 코딩 작업에서는 다른 대형 모델이 여러 해법을 만든 뒤 CLM이 그중 하나를 검증·선택하는 방식을 시험했다. 연구진 설명대로 이 모델의 의미는 장문의 추론을 직접 수행하는 데 있지 않고, 선택지가 정해진 환경에서 판단과 검증을 더 빠르고 저렴하게 처리하는 데 있다.






