퀄컴 테크놀로지스는 10일(현지시간) 에이전틱 AI를 스마트폰에서 직접 구동하기 위한 차세대 퀄컴 헥사곤 NPU를 공개했다. 이번 공개의 핵심은 모바일 AI 처리 방식이 바뀌는 데 맞춰 NPU의 연산과 메모리 아키텍처를 다시 설계했다는 점이다. 기사에 따르면 기존의 대규모 단일 AI 모델 하나를 구동하는 방식에서 벗어나, 작업과 상황에 따라 여러 특화 모델을 선택적으로 실행하는 구조를 겨냥했다.

새로운 NPU에는 트랜스포머 연산에 특화된 전용 엘리먼트 가속기와 기존보다 50% 확대된 공유 메모리 시스템이 적용됐다. 엘리먼트 가속기는 생성형 AI와 에이전틱 AI의 핵심 모델 구조인 트랜스포머 연산을 처리하도록 설계됐고, 스칼라·벡터·매트릭스 확장 기능을 결합해 대규모 AI 모델에서 반복적으로 발생하는 연산을 가속하도록 구성됐다.

이 변화가 중요한 이유는 에이전틱 AI가 한 번의 질문 응답으로 끝나지 않기 때문이다. 사용자의 맥락을 파악한 뒤 여러 단계의 추론과 도구 호출, 작업 실행을 이어가려면 긴 문맥을 유지하면서 여러 작업을 동시에 처리하고, 각 단계에서 빠르게 결과를 돌려주는 구조가 필요하다. 퀄컴은 새로운 헥사곤 NPU가 이런 지속적인 AI 처리, 긴 문맥 추론, 멀티모달 모델, 동시 에이전트 실행, 낮은 지연시간을 고려해 설계됐다고 설명했다.