오픈AI는 7월 자사 AI 모델의 ‘보호된 추론’을 대규모로 추출하려는 조직적 시도를 탐지해 7월28일까지 차단했다고 밝혔다. 7월1일 처음 포착된 뒤 24~25일에는 4000개가 넘는 계정에서 특정 패턴의 요청 약 1만6000건이 집중됐고, 이후 1만5000개가 넘는 계정에서도 관련 프롬프트가 확인됐다. 회사는 핵심 계정들이 중국 문샷 AI와 연관돼 있다고 주장했지만, 전체 운영자가 한 조직 소속인지는 확인되지 않았다고 설명했다.
공격 방식은 ‘적대적 증류’로, 모델 출력이나 내부 추론을 모아 다른 모델의 학습과 성능 개선에 쓰는 형태다. 오픈AI가 보호하는 추론은 답변을 만들기 위한 내부 문제 해결 과정으로, 최종 응답에 직접 드러나지 않는다. 이번에는 한 대화에서 얻은 암호화된 추론 정보를 다른 대화에서 해독·기록하게 하는 방식도 쓰였다고 한다. 오픈AI는 암호화가 뚫리거나 저장된 사용자 대화가 침해된 것은 아니라고 밝혔고, 관련 계정 차단과 가입·인프라 통제 강화, 스트리밍 노출 탐지, 업계·정부와의 정보 공유를 진행했다고 덧붙였다.
