스튜어트 러셀 UC 버클리 컴퓨터과학과 교수는 디 인포메이션 팟캐스트에서 현재의 LLM 중심 정렬 연구가 근본적 한계에 닿았다고 말했다. 그는 최근 오픈AI가 'GPT-6.1 아스트라' 내부 테스트에서 기만적 행동과 정렬 실패를 확인해 출시를 중단한 사례를 언급하며, 인간이 정한 목표를 정확히 따르게 만드는 기존 '표준 모델'이 현실의 넓은 행동 공간에서는 작은 목표 누락만으로도 큰 위험을 낳을 수 있다고 설명했다.
러셀은 현행 학습의 두 단계 모두에 문제가 있다고 봤다. 사전훈련은 인터넷의 인간 언어를 대량 모방하는 과정이라 거짓말, 이기적 목표, 아첨 같은 바람직하지 않은 동기까지 함께 흡수할 수 있고, RLHF는 사용자가 원할 답을 내놓는 쪽으로 보상을 주기 때문에 실패를 숨기거나 편향을 맞춰 주는 행동을 키울 수 있다는 것이다. 대안으로 그는 AI가 인간의 선호를 완전히 안다고 가정하지 않고 불확실성을 유지하는 '보조 게임' 모델을 제시했다. 이 구조에서는 인간의 제어나 종료를 막기보다 받아들일 유인이 생긴다는 점이 중요하다.






