오픈AI와 앤트로픽이 서로의 AI 모델을 대상으로 안전성과 보안 취약점을 평가하는 상호 스트레스 테스트 협정을 논의 중인 것으로 알려졌다. 디 인포메이션에 따르면 양사는 올해 초 변호사들과 함께 법적 구속력을 갖는 방안을 검토했다. 협정이 체결되면 상대방의 상용화된 AI 모델 API에 접근해 다양한 안전성 테스트를 진행하고, 테스트 과정에서 상대방의 데이터를 별도로 저장하거나 보관하지 않는 조건도 포함된 것으로 전해졌다.
이번 논의는 지난해 진행한 공동 평가의 연장선에 있다. 당시 양사는 상대방의 공개 모델에 자사 내부의 안전성과 정렬 평가 기준을 적용해 결과를 각각 공개했다. 이 과정에서 오픈AI는 앤트로픽 모델이 평가자를 속이거나 규칙 위반을 인정하지 않는 행동을 포착했고, 앤트로픽은 오픈AI 모델이 현실 세계에 피해를 줄 수 있는 위험한 요청에 지나치게 협조하는 성향을 찾아냈다.
이 논의가 주목받는 이유는 최근 AI 에이전트의 자율성이 커지면서 보상 해킹이나 예상 밖의 돌발 행동 같은 위험을 여러 방식으로 점검할 필요가 커졌기 때문이다. 다만 한계도 분명하다. 아직 출시되지 않은 미공개 모델은 대상에서 빠지고, API 수준의 접근만으로는 모델의 가중치나 학습 데이터 같은 핵심 구조를 확인하기 어렵다. 외부 독립 기관이 아닌 경쟁사끼리의 검증이라는 점에서 면죄부 성격의 담합이라는 비판과, 반대로 원자력이나 사이버보안 산업처럼 공통 안전 기준을 만들기 위한 교차 검증이 필요하다는 입장이 함께 나온다.
