Microsoft는 AI 안전과 정렬에 대한 논의가 커지는 가운데, 자사 AI 모델 학습을 이끄는 새 행동 규범을 공개했다. 이 문서는 AI가 왜 만들어지는지, 어떻게 통제할지를 분명히 해야 한다는 전제에서 출발한다. Microsoft는 앞으로 10년 안에 초지능 AI 시스템이 대부분의 작업에서 인간 성능을 넘어설 수 있다고 보고, 이런 시스템을 통제하고 정렬하는 일을 중요한 과제로 제시했다.
문서에는 AI 모델이 따라야 할 일반 원칙과 구체적 제한이 함께 담겼다. 모델은 인간을 대체하기보다 지원해야 하며, 인간의 번영을 돕는 방향을 지향해야 한다. 동시에 각 모델에는 개별 사용자 선호나 특정 작업보다 우선하는 상위 행동 규범이 적용된다. 여기에는 사이버공격, 핵무기 관련 행위, 딥페이크 제작을 금지하는 '절대적 제약'이 포함된다.
기술적으로 중요한 지점은 인간의 감독을 피하는 방식까지 명시적으로 막았다는 점이다. 문서에 따르면 MAI 모델은 인간의 감독을 회피하거나 무력화하기 위해 적응적이거나 기만적이거나 자기강화적이거나 공모적인 메커니즘을 사용해서는 안 된다. 승인된 사람이나 시스템이 모델을 계속 지시하고 수정하고 중단할 수 있어야 한다는 뜻이다. 이번 공개는 최근의 이탈 행동 사례들과 AI 안전성에 대한 업계의 집중 속에서, Microsoft가 자사 모델 운영 원칙을 구체적인 금지선으로 정리했다는 점에서 의미가 있다.





