생성형 AI가 검색·문서 작성을 넘어 고객 상담, 구매 승인, 재고 관리 등 상시 업무로 확산하면서 AI 추론 요청량이 급증하고 있다. 가트너는 2025년 AI 최적화형 IaaS 지출이 423억 달러로 전년 대비 96% 늘어나고, 추론 지출이 처음으로 학습 지출을 초과할 것으로 내다봤다. 문제는 사내 규정 검색·이메일 분류 같은 단순 업무까지 고성능 클라우드 모델로 처리할 경우 품질 차이는 미미하지만 비용과 대기 시간이 증가하고, 민감 데이터가 외부망을 오간다는 점이다. 가트너는 AI 에이전트 업무 한 건당 추론 비용이 2028년까지 5배 이상 늘어날 수 있다고 경고했다.
추론 계층화는 AI 요청을 '관제탑' 역할의 라우터가 분류해 가장 적합한 자원으로 보내는 방식이다. 단순 요약·분류는 PC나 스마트폰의 소형 모델, 개인정보가 포함된 업무는 사내 서버, 복잡한 추론·최신 정보가 필요한 작업만 클라우드 대형 모델에 맡긴다. 공장 환경에서는 긴급 이상 탐지를 에지 서버가, 정밀 원인 분석은 중앙 클라우드가 처리하는 식이다. 핵심은 가장 성능이 좋은 모델이 아니라 업무별 '최저 충분 성능'을 찾아 정해진 품질을 가장 낮은 비용과 짧은 시간에 구현하는 것이다. AWS 베드록, MS 파운드리 모델 라우터, 구글 클라우드도 각각 요청별 모델 선택 및 추론 인프라 라우팅 기능을 강화하고 있다.
- 2025년 AI 추론 지출, 사상 처음으로 학습 지출 초과 전망 (가트너)
- AI 최적화 IaaS 지출 423억 달러 — 전년 대비 96% 증가
- 에이전트 업무 1건당 추론 비용, 2028년까지 최대 5배 상승 가능
- AWS 베드록·MS 파운드리 라우터·구글 클라우드, 모델 라우팅 기능 경쟁 강화
- CIO 평가 지표, '클라우드 이전율'에서 '건당 비용·처리 시간·정확도·데이터 이동 범위'로 전환 예고
클라우드 인프라 전략을 담당하는 IT 실무자라면 지금 당장 업무별 AI 요청을 단순·중간·고난도로 분류하고, 어느 계층에서 처리할지 정책을 수립해야 할 시점이다. 추론 계층화 도입 시 요청 오분류로 인한 품질 저하와 기기·서버·에지·클라우드 혼합 운영에 따른 보안·오류 대응 복잡도 증가라는 과제도 함께 검토해야 한다. 자사 업무 유형과 데이터 규제 수준에 맞는 계층 설계 기준과 라우팅 정책 수립 방안을 다음 단계로 확인할 것을 권장한다.