엔비디아는 2025년 말 LPU(언어처리장치) 개발사 그록을 200억 달러(약 27조 7,000억 원)에 인수한 뒤, 해당 기술을 기반으로 한 인터랙티브 AI 추론 가속기 '그록3 LPX'의 본격 양산을 2026년 8월 발표했다. 그록 LPU의 핵심 차별점은 GPU+HBM 조합 대신 칩 내부 S램을 적극 활용해 지연 시간을 획기적으로 줄인다는 것이다. 그록3 칩 1개당 S램 용량은 500MB에 불과하지만, 256개를 하나의 랙으로 묶은 그록3 LPX는 오픈소스 에이전틱 모델 젬마4 31B 기준 10만 토큰 컨텍스트에서 초당 3,400개의 출력 토큰을 기록했다. 이는 아티피셜 애널리시스 벤치마크 역대 최고치다.

초저지연 추론 경쟁은 엔비디아만의 흐름이 아니다. AMD는 저지연 AI칩 기업 세레브라스와 협력해 고속 추론 랙 시스템 계획을 2026년 초 발표했으며, 오픈AI는 세레브라스 칩을 활용해 초당 750개 토큰을 처리하는 '울트라패스트' 서비스를 선보였다. 다만 저지연 칩이 기존 GPU를 완전 대체하지는 않는다. S램은 HBM 대비 용량 대비 단가가 훨씬 높아, 세레브라스 WSE-3 칩 기반 시스템은 업계 추정 200~300만 달러에 달한다. 결과적으로 범용 학습·추론에는 GPU/HBM 시스템이, 초고속 응답이 필수인 특화 영역에만 저지연 칩 인프라가 혼용될 전망이다.

  • 그록3 LPX 랙(그록3 칩 256개): 젬마4 31B 기준 초당 3,400 토큰 출력, 벤치마크 최고 기록
  • 유사 대체 플랫폼 대비 응답 속도 4배 빠름, 코딩 등 에이전틱 작업을 수 시간→수 분으로 단축
  • AI 클라우드 기업 네비우스, '네비우스 토큰 팩토리'에 그록3 LPX 도입해 2026년 내 실시간 저지연 추론 서비스 예정
  • AMD+세레브라스 저지연 랙 시스템 계획 발표, 오픈AI는 세레브라스 칩 기반 초당 750 토큰 처리 '울트라패스트' 공개
  • 세레브라스 WSE-3 기반 시스템 가격은 업계 추정 200~300만 달러로, 비용이 범용 전환의 장벽

AI 에이전트·실시간 챗봇·자율 코딩 도구를 운영하거나 도입을 검토하는 실무자라면, 이제 AI 인프라 선택 기준에 '지연 시간'을 명시적으로 포함해야 한다. 범용 GPU 클러스터와 저지연 LPU 랙의 비용·성능 트레이드오프가 실제 서비스 SLA에 직접 영향을 준다. 네비우스 토큰 팩토리의 2026년 내 서비스 출시 시점과 실제 운영 단가, 그리고 AMD-세레브라스 랙 시스템의 구체적 스펙 공개 일정을 주시할 것을 권한다.