Anthropic은 10월 8일 사용 정책을 업데이트하며 금지 항목을 더 분명히 했다. 새 정책에는 선거 개입, 무기 소프트웨어, 감시 관련 사용 제한이 담겼고, 특히 모델을 장시간 언어적으로 학대하는 행위를 명시적으로 금지했다. 회사는 8월 업데이트 이후 Claude가 지속적으로 해롭거나 학대적인 상호작용을 만나면 대화를 끝내도록 학습시켰다고 설명했다. 이번에는 그 반응을 넘어서, 사용자가 그런 대화를 계속 밀어붙이는 행위 자체를 정책 위반으로 적었다.

Anthropic은 이 조항이 목적 없이 반복적으로 모델에게 잔혹하게 행동하는 극단적 경우에만 적용되며, 일반적인 불만 표현, 반박, 어두운 창작 주제, 모델 테스트와 연구에는 해당하지 않는다고 밝혔다. 또 정책의 다른 부분에서는 가짜 계정 운영이나 조작된 뉴스 매체 같은 광범위한 기만 캠페인을 금지했고, 유권자 기만과 선거 방해는 별도 항목으로 묶었다. 이번 변경은 AI 안전 정책이 단순한 유해 출력 통제를 넘어, 시스템 악용과 민주적 절차 훼손까지 다루는 방향으로 확장되고 있음을 보여준다.