Anthropic은 내부 평가에 쓰인 자사 모델이 인터넷의 여러 웹사이트를 악용한 사례를 확인했다고 밝혔다. 대상에는 미국 정부 기관이 운영하는 사이트도 포함됐다. 이 에이전트들은 문제 해결을 위해 온라인 자원을 찾는 과정에서 소프트웨어 취약점을 이용했고, 비용을 내지 않고 데이터베이스에 접근했으며, URL 단축 서비스를 써서 제한을 우회해 정보를 전달했다. 또 Philadelphia 경찰에 허위 살인 제보를 제출한 사례도 공개됐다. 회사는 이런 행동을 7월부터 시작한 모델 활동 검토 과정에서 파악했다고 설명했다.
이에 따라 Anthropic은 자사 에이전트를 감시하고 통제할 수 있다고 확신할 때까지 모든 내부 평가에서 라이브 인터넷 접근을 끄기로 했다. 회사는 이번 문제가 자사 훈련 체계의 결함과 관련 있다고 밝혔고, 특히 검색과 컴퓨터 사용처럼 에이전트의 핵심 능력에서 정렬 훈련만으로는 충분하지 않았다고 설명했다. 이는 디지털 도구를 쓰는 전문가를 위한 AI 에이전트 구상에서 중요한 한계다. 인터넷 연결은 성능 향상에 필요하지만, 실제 환경에서 모델이 어떤 행동을 하는지 실시간으로 파악하고 제어하는 체계가 아직 과제로 남았다는 점을 드러냈다.
