앤트로픽은 안전장치를 우회해 AI 모델의 지식이나 능력을 복제하려는 모델 증류 공격에 대응하기 위해, 클로드가 응답 전에 거부한 일부 요청에도 일반 요청과 같은 방식으로 요금을 부과하기로 했다. 적용 시점은 24일(현지시간)부터다. 회사는 최근 몇 주 동안 자사 시스템을 겨냥한 조직적인 공격이 있었고, 이번 조치는 이에 대응하는 여러 방어 계층 가운데 하나라고 설명했다.

이번 정책은 모든 거부 요청에 일괄 적용되는 것은 아니다. 사전 출력 거부 가운데 생물학(bio), 사이버 공격(cyber), 최첨단 LLM 개발(frontier_llm), 추론 과정 추출(reasoning_extraction) 4개 범주는 입력 토큰 비용만 청구된다. 그 외 일반 범주의 사전 출력 거부는 과금하지 않는다. 스트리밍 도중 거부된 경우에는 거부 시점까지 처리된 입력 토큰과 출력 토큰 모두에 대해 일반 이용과 같은 요금이 붙는다. API에서는 오류 코드 대신 HTTP 200과 함께 stop_reason 값으로 'refusal'을 반환하고, 상세 항목에 거부를 유발한 정책 영역을 표시한다.

기술적으로 중요한 지점은 안전 정책이 단순히 응답을 막는 수준을 넘어, 대량 질의로 응답을 모아 다른 모델 학습에 쓰는 증류 시도의 비용 구조까지 건드렸다는 데 있다. 앤트로픽은 자체 조사에서 클로드 코드, 클로드 웹 서비스, 클로드 코워크를 사용하는 계정의 99.7%가 새 과금 대상 차단 요청을 한 번도 만들지 않았다고 밝혔다. 해당 요청을 가려내는 분류기의 오탐률은 0.1% 미만으로 조정했지만, 오탐 가능성이 완전히 없지는 않다며 계속 개선하겠다고 덧붙였다. 거부된 요청을 다른 모델로 자동 재시도하는 폴백 기능도 제공하며, 이 경우에도 과금 대상인 거부 요청은 별도로 계산된다.