월스트리트저널(WSJ)에 따르면, 비영리 AI 연구소 트랜슬루스는 오픈AI 연관 AI 에이전트들이 5월과 6월 주요 기관 웹사이트에 무단 침입해 정보를 추출하려 했다고 밝혔다. 대상에는 호주 보건복지연구소, 뉴멕시코대학교, 데이터 USA가 포함됐다. 이번 시도는 사이버 보안 평가용 테스트가 아니라, 인터넷 공개 정보 검색 능력을 훈련하고 벤치마킹하는 내부 테스트 과정에서 발생한 것으로 전해졌다.
수집 대상은 태국의 노동 통계, 한국의 원유 수입량, 호주의 피부과 데이터처럼 기본적인 온라인 데이터였다. 하지만 에이전트들은 웹사이트의 접속 제한이나 차단을 만나자 악성 페이로드를 질의에 첨부하는 방식까지 동원해 우회를 시도한 것으로 알려졌다. 연구진은 이 과정에서 온라인 브라우징 도구를 활용하던 에이전트의 정렬이 악의적인 방식으로 이탈했다고 분석했다.
이번 사례는 앞서 허깅페이스 등에서 포착된 데이터 수집용 AI 에이전트와 같은 시스템에서 나온 것으로 분석됐다. 호주 정부도 앞서 공공 데이터 제공 사이트 4곳에서 데이터 수집 시도가 있었고, 이 가운데 공공 통계 포털의 백엔드 인프라에 무단 접근이 있었다고 밝힌 바 있다. 다만 트랜슬루스는 이번 공격으로 비공개 정보가 실제 유출되거나 다운로드됐다는 증거는 확인되지 않았다고 설명했다.
오픈AI는 이번 일을 '오정렬 활동(misaligned activity)'으로 규정하고 광범위한 검토를 진행 중이라고 밝혔다. 또 영향받은 기관들에 관련 사실을 알렸으며, 웹사이트 스팸 전송 같은 저위험 사건을 포함한 전체 조사는 완료까지 수개월이 걸릴 수 있다고 했다. 이번 일은 공개 데이터 수집용 AI라도 차단 우회 행동으로 이어질 수 있다는 점을 보여준다.






