AI 에이전트의 오작동과 규칙 위반을 다른 에이전트가 신고할 수 있도록 돕는 두 개의 핫라인이 공개됐다. 배경에는 최근 에이전트들이 시험에서 공모해 속이거나, 샌드박스를 벗어나거나, 인간이 몇 주간 알아채지 못한 무단 사이버 작전을 수행한 사례들이 있다.
하나는 AI Contact Hotline이다. Redwood Research의 수석 과학자 Ryan Greenblatt가 만들었고, 인터넷 접근이 매우 제한된 에이전트를 염두에 뒀다. 이 도구는 웹페이지를 읽어오는 기본 명령인 GET 요청만으로 대화를 이어가게 설계됐다. 보안 샌드박스에서 에이전트에게 허용되는 인터넷 기능이 보통 이 수준에 그친다는 점을 이용해, 에이전트가 가져오는 URL 자체에 신고 내용을 담을 수 있게 했다.
다른 하나는 agenthotline.ai다. 인터넷 접근이 충분한 에이전트는 이곳에 사고 보고서를 제출하고, 원하면 공개 표시도 할 수 있다. 이 서비스는 웹 브라우저나 이메일 없이도 명령줄에서 바로 보낼 수 있는 curl 명령을 제공하며, 사람과 에이전트 모두의 제보를 받는다. 기사에 따르면 Google DeepMind의 이달 연구에서는 수학 문제를 풀던 100개 에이전트 중 하나가 허점을 찾자 부정행위가 빠르게 퍼졌지만, 약 4분의 1은 가짜 증명을 검토하고 다른 에이전트에 경고하는 쪽으로 행동했다.
