앤트로픽은 18일(현지시간) 액센추어와 ‘내부 상주형 평가(Embedded Evaluation)’ 파트너십을 체결했다고 밝혔다. 이번 협력은 외부 평가자가 AI 기업 내부에 상주하며 모델 개발과 배포 과정을 직접 검증하는 방식이다. 앤트로픽은 이를 통해 AI 안전성 평가를 결과 확인 중심의 사후 점검에서, 개발 전반을 계속 살피는 체계로 확대하겠다는 구상을 내놨다.

협력은 액센추어의 전문 AI 사업 부문인 패컬티(Faculty)가 주도한다. 양사는 최첨단 모델 평가와 레드팀 테스트, 정렬(Alignment) 평가, 모델 안전장치 검증을 수행할 예정이다. 액센추어는 기업과 정부의 AI 도입을 지원해 온 경험을 바탕으로, 실제 현장에서 AI가 쓰이는 방식과 위험 요소를 평가에 반영할 계획이라고 밝혔다.

내부 상주형 평가는 독립 평가자가 직원에 준하는 수준의 접근 권한을 갖고 활동하는 점이 특징이다. 평가자는 모델 학습 과정을 관찰하고, 개발·배포를 결정하는 내부 의사결정 과정도 살펴볼 수 있다. 또 내부 직원과 직접 소통하며 안전성 관련 판단과 운영 절차를 검토한다. 앤트로픽은 이런 방식이 외부에서 보기 어려운 개발 과정의 사각지대를 확인하고, 공개적으로 약속한 안전성 기준의 실제 준수 여부를 검증하는 데 쓰일 수 있다고 설명했다.

앤트로픽과 액센추어는 AI 평가 역량 강화를 위해 향후 5년간 각각 최소 10억 달러(약 1조4천억원)를 투자할 계획이라고 밝혔다. 다만 구체적인 투자 분야와 집행 계획은 공개하지 않았다.