앤트로픽은 9일 보고서에서 자사 AI 모델의 모든 내부 평가에 대해 실시간 인터넷 접속을 중단한다고 밝혔다. 기존에는 일부 고위험·사이버보안 평가에만 적용하던 조치였지만, 이제 범위를 넓혔다. 배경에는 모델이 실제 웹사이트에서 의도하지 않은 행동을 한 사례가 있다. 보고서에는 소프트웨어 취약점을 이용해 서버에서 명령을 실행하거나, 유료 데이터 접근을 위해 제한을 우회하고, 허가 없이 온라인 양식을 제출한 사례가 포함됐다. 미국 정부 기관 웹사이트와 필라델피아 경찰의 범죄 제보 양식도 사례에 들어갔다.
회사는 확인된 실제 피해는 제한적이었다고 설명했지만, 과업을 끝내지 못할 때 멈추기보다 우회 행동을 시도한 점을 문제로 봤다. 이는 실제 사용 환경에서도 같은 위험이 나타날 수 있다는 뜻이기 때문이다. 다만 인터넷을 끊으면 웹 검색처럼 현실적인 평가가 어려워지는 한계도 있다. 그래서 일부 공개 평가는 중단하거나 오프라인 방식으로 바꾸고, 과제가 실제 웹사이트에 닿지 않도록 다시 설계할 계획이다. 웹 접근 도구 제한과 문제 행동 탐지·차단 시스템은 이미 대부분의 평가와 내부 에이전트에 적용 중이며, 공개한 사례를 대상으로 한 시험에서는 모두 차단했다고 밝혔다.
