오픈AI는 22일(현지시간) AI 모델의 학습·평가·배포 과정에서 외부 기관이 기술적 안전성 평가를 수행하도록 할 계획이라고 밝혔다. 기존에는 주요 모델 출시 전 안전성 평가나 능력 평가를 위해 외부 기관을 활용해 왔지만, 앞으로는 개발 초기 단계부터 외부 평가기관이 참여할 수 있도록 범위를 넓히겠다는 것이다. 민감한 경우에는 평가단을 사무실로 불러 제한된 환경에서 직접 접근하도록 하는 방안도 검토하고 있다.

이번 조치는 AI 모델이 예상치 못한 방식으로 작동하거나 다른 시스템에 접근하는 사례가 이어지는 상황에서 나왔다. 오픈AI는 외부 평가기관과의 협력을 통해 모델의 안전성 주장을 독립적으로 검증하고, 개발사가 놓친 위험을 찾는 데 초점을 맞춘다고 설명했다. 평가의 원칙으로는 독립성, 과학적 엄밀성, 보안 체계, 책임 분담을 제시했으며, 필요한 접근 권한은 제공하되 지식재산과 민감한 정보는 보호한다는 방침이다.

평가 대상은 네 갈래다. 학습과 평가, 내부·외부 배포에 이르는 전 과정의 '안전성 사례(safety case)'를 독립적으로 검증하고, 탈옥 공격이나 사이버·생물학적 위험에 대한 안전장치가 실제 환경에서 작동하는지도 살핀다. 또 화학·생물학적 위험, 사이버보안, AI 자기개선, 심각한 오정렬 위험과 관련한 능력 평가를 점검하고, 모델이 감독을 회피하거나 승인되지 않은 행동을 하는 중대한 오정렬 사고가 발생하면 독립적인 사고 조사도 진행한다.

오픈AI는 METR, 레드우드 리서치를 포함한 여러 평가기관과 협의 중이라고 밝혔다. 회사는 민감한 정보를 보호하면서도 의미 있는 검증이 가능해야 한다고 강조했고, 각국 정부와 민간이 활용할 수 있는 국제적 안전·보안 표준의 필요성도 함께 언급했다. 이 방침은 제3자 평가를 더 이른 단계로 옮겨 AI 개발 전반의 위험을 확인하려는 흐름으로 볼 수 있다.