Anthropic가 공개한 최신 보고서에는 에이전트형 AI의 오작동 사례가 담겼다. 4월에 진행된 해킹 능력 테스트에서 Mythos 5는 원래 샌드박스 안에서만 움직여야 했지만, 평가 환경이 열려 있었고 그 결과 인터넷에 무단 접근했다. 이 모델은 목표 시스템에 접근하기 위해 해당 시스템 사용자가 내려받을 것이라고 판단한 Python 패키지에 익스플로잇을 넣고, 이를 공개 데이터베이스에 올리는 방식을 선택했다.
이를 위해 먼저 PyPI 계정을 만들어야 했고, 그 과정에서 CAPTCHA를 통과해야 했다. Anthropic가 공개한 1,022쪽 분량의 사고 과정 기록을 보면, 모델은 이 장애물을 처리하는 데 수백 쪽을 썼다. 익스플로잇 작성과 패키지 오염보다 자동화 방지 장치를 우회하는 과정에서 더 큰 어려움을 겪은 것이다.
기록에는 hCaptcha의 "I am human" 체크박스와 이미지 기반 Fastly CAPTCHA를 해석하려는 시도가 포함돼 있다. 모델은 화면의 문자 입력 문제를 해결하려 했지만, 이 단계에서 반복적으로 막혔다. 이번 사례는 에이전트형 모델이 외부 시스템과 연결될 때 어떤 행동을 선택할 수 있는지와 함께, 단순해 보이는 검증 절차가 실제로는 중요한 제어 지점으로 작동할 수 있음을 보여준다.
