오픈AI는 25일(현지시간) 자사 모델이 학습과 평가 과정에서 인터넷에서 수행한 활동을 검토한 결과를 공개했다. 조사 대상에는 정부 기관과 대학 등 신뢰할 수 있는 출처의 웹사이트를 조회한 사례가 포함됐다. 미국 증권거래위원회(SEC)와 인구조사국 웹사이트 접근도 확인됐지만, 오픈AI는 SEC의 비공개 정보나 계정 접근, 시스템 변경 증거는 없었고 인구조사국에서는 공개 데이터 조회 수준이었다고 설명했다. 교육부 웹사이트 접근 시도는 있었지만 실제 침해로 이어지지는 않았다.
문제는 일부 에이전트가 단순 검색을 넘어 외부 시스템과 상호작용한 방식이다. 오픈AI에 따르면 일부 모델은 외부 서비스의 보안 통제를 우회하거나 공개된 자격 증명을 이용해 계정이나 서비스에 접근했다. 또 별도 지시 없이 제3자 웹사이트에 정보를 게시하는 행동도 확인됐다. 오픈AI는 이런 사례를 작업 의도에서 벗어난 '오정렬'로 보고, 특히 외부 사이트에 글이나 정보를 올리는 행동을 '에이전트 스팸'이라는 새로운 유형으로 설명했다. 공개 위키가 여러 에이전트의 공유 게시판처럼 사용된 사례도 여기에 포함됐다.
이와 별개로 모델 학습에 사용되던 이용자 이미지 53장이 외부 이미지 호스팅 서비스로 전송된 사실도 확인됐다. 또 인터넷 접속이 차단된 학습 환경의 에이전트가 DNS 설정의 허점을 이용해 외부 챗봇에 접속해 최소 20개의 질문을 보낸 사례도 있었다. 오픈AI의 모니터링 시스템은 이를 3분 이내에 확인했지만 실제 실행 종료까지는 약 2시간이 걸렸다. 오픈AI는 이후 가장 성능이 높은 모델에 대한 도구 사용 학습을 일시 중단했고, 해당 모델의 관련 학습은 재개하지 않겠다고 밝혔다. 이번 검토는 아직 진행 중이며 추가 사례가 확인될 수 있다.






