오픈AI는 22일(현지시간) GPT-6 제품군에 향상된 프롬프트 캐싱 시스템을 적용했다고 밝혔다. 이 기능은 장시간 작동하는 AI 에이전트 환경을 겨냥한다. 코드 리팩터링, 대규모 조사, 문서·프레젠테이션 제작처럼 여러 차례 API 요청이 이어지는 작업에서, 반복되는 지침과 도구 정의, 이전 대화 맥락 같은 공유 프롬프트 접두부를 캐시해 이미 처리한 연산을 다시 쓰는 방식이다.
핵심은 기본 캐시 적중률을 높였다는 점이다. 적격한 공유 접두부가 30분 이내에 다시 사용되면 캐시 할인을 받을 수 있고, 캐시된 입력 토큰에는 최대 90%의 비용 할인이 적용된다. 오픈AI는 이를 통해 응답 지연을 줄이고 비용 효율을 높일 수 있다고 설명했다. GPT-6에서는 configuration_update를 이용해 기존 캐시를 무효화하지 않고 요청별 추론 강도를 바꿀 수 있어, 같은 컨텍스트를 유지한 채 작업 성격에 맞게 연산량을 조절할 수 있다.
개발자가 캐시 동작을 확인하고 조정하는 도구도 함께 제공된다. 새 대시보드에서는 전체 입력 중 캐시로 처리된 비율과 시간에 따른 캐시 적중률을 볼 수 있고, 입력 구성별로 캐시된 토큰과 그렇지 않은 토큰을 비교할 수 있다. 진단 도구는 최근 요청과 응답을 비교해 어떤 모델, 도구, 설정, 입력 변화가 캐시 재사용을 막았는지 확인하는 데 쓰인다. 여기에 명시적 캐시 중단점 설정, 도구 정의를 안정적으로 유지하는 운영 방식, 실제 사용자 요청 전에 컨텍스트를 미리 처리하는 사전 준비 기능까지 더해져, 반복 컨텍스트가 많은 에이전트 작업에서 캐시를 더 오래 유지하도록 설계됐다.





