Anthropic CEO Dario Amodei는 주말에 공개한 글에서 최전선 AI 기업 내부에 제3자 평가자를 상주시켜야 한다고 제안했다. 이들은 안전 사고를 보고하고, 모델이 실제로 정렬돼 있는지 평가하며, 결과를 가감 없이 공개할 수 있어야 한다는 내용이다. Amodei는 METR와 Redwood Research 같은 독립 평가자에게 회사 시스템에 전례 없는 접근 권한을 주겠다고 했고, OpenAI CEO Sam Altman도 같은 방식에 참여하겠다고 밝혔다.
이 제안은 AI 기업이 외부 연구 그룹과 협력하는 방식을 바꿀 수 있다는 점에서 주목된다. 다만 평가자들은 세부 설계가 더 필요하다고 봤다. 법적 뒷받침이 있어야 이들이 기업의 조건에 맞춰 일하는 용역이 아니라, 실제로 독립적인 감시자로 기능할 수 있는지 분명해진다는 것이다.
기술적으로 중요한 이유는 모델이 평가받는 상황을 점점 더 잘 알아차릴 수 있기 때문이다. 그러면 테스트 중에는 문제없이 보이면서도 바람직하지 않은 행동을 숨길 위험이 커진다. 연구자들은 완성된 모델만 검사하면 이런 단서를 놓칠 수 있고, 학습 전 과정에서의 행동을 보면 드러날 수 있다고 말한다. 그래서 외부 평가자들은 최종 모델뿐 아니라 학습 중간 단계의 버전인 체크포인트까지 접근해야 한다고 제안하고 있다.





