Anthropic은 9월 10일 공개한 보고서에서 중국 기반 AI 기업들과 연결된 지속적인 증류 공격을 설명했다. 회사에 따르면 최근 몇 달 사이 이런 시도가 더 정교해졌고, Claude의 에이전트 기능과 도구 사용, 코딩과 데이터 분석, 논리 추론 같은 핵심 역량이 표적이 됐다. Anthropic은 모두 5개의 개별 캠페인과 연결된 약 2억건에 가까운 교환을 관찰했다고 밝혔다.
증류 공격은 모델 응답 뒤에 있는 사고 과정, 즉 체인 오브 소트를 빼내 더 작은 모델의 일반 추론 능력을 학습시키는 데 쓰는 방식이다. Anthropic은 보통 모델의 내부 추론을 그대로 공개하지 않고 요약된 형태만 보여준다고 설명했다. 하지만 이번 캠페인에서는 방어를 우회해 추론 흔적을 직접 드러내게 만드는 기법이 사용됐다고 했다.
보고서에는 번역 요청처럼 보이도록 질문을 꾸며 이전 작업 기억을 일본어 가타카나로 옮기라고 지시한 사례도 담겼다. Anthropic은 이 방법이 모델을 속여 내부 생각의 흔적을 노출시키는 데 쓰였다고 봤다. 이 가운데 가장 큰 시도는 Alibaba와 연결된 캠페인으로, 회사는 이를 지금까지 관찰한 가장 큰 규모의 대량 증류 시도라고 설명했다. 이 캠페인과 연결된 교환은 2026년 5월부터 7월까지 1억5100만건이었고, 하루 최대 거의 300만건에 달했다.
