이 글은 에이전트형 AI가 사람 대신 일을 처리할수록, 실제 비용 구조가 더 복잡해지고 있다는 점을 설명한다. 사용자는 짧은 요청 한 번만 보지만, 뒤에서는 여러 AI가 역할을 나눠 계획을 세우고 정보를 찾고 결과를 다시 확인한다. 문제가 생기면 처음 단계로 돌아가 같은 과정을 반복할 수 있어, 최종 답변보다 훨씬 많은 토큰이 내부에서 소비된다.

본문은 항공권 예약 같은 예로 이를 보여준다. AI는 출발 조건을 확인하고, 항공편을 찾고, 가격과 시간, 수하물 조건을 비교한 뒤, 예약 직전 다시 좌석과 가격이 맞는지 확인해야 한다. 사람에게는 한 번의 부탁이지만 AI에게는 여러 번의 처리다. 그래서 토큰 하나의 가격이 내려가더라도, 작업을 끝내기 위해 쓰는 토큰 총량이 빠르게 늘어나면 전체 비용은 오히려 커질 수 있다.

이 문제를 줄이기 위한 기술로는 일을 푸는 순서와 도구 사용 방식을 정하는 하네스, 이전 계산 결과를 저장해 다시 쓰는 KV 캐시, 여러 시스템이 메모리를 효율적으로 공유하도록 돕는 CXL이 제시된다. 핵심은 더 싼 토큰만 찾는 것이 아니라, AI가 같은 계산을 반복하지 않게 하고 한 번의 작업을 더 적은 자원으로 끝내게 만드는 것이다. 이는 앞으로 예약, 분석, 정비 같은 실제 업무를 AI가 맡을 때 서비스의 가격과 품질을 좌우하는 기준이 된다.