인셉션은 2026년 9월 29일 기업용 음성 에이전트 모델 ‘머큐리 보이스’를 정식 출시했다. 이 모델은 기존 자율회귀 방식 대신 확산 기반 언어모델 구조를 음성에 적용했다. 순차적으로 토큰을 만드는 방식은 프롬프트가 길어지거나 추론이 복잡해질수록 응답이 늦어지는 경향이 있는데, 머큐리 보이스는 문맥과 토큰을 병렬로 처리해 이런 지연을 줄이도록 설계됐다. 음성 대화에서 응답 속도와 성능 사이의 타협을 줄이려는 접근이다.
실제 고객 서비스 요청 기반 테스트에서 첫 응답 토큰 시간 중앙값은 320ms 미만이었고, 95번째 백분위 지연시간도 750ms 수준이었다. 인셉션은 이를 바탕으로 주요 경쟁 모델보다 2배 이상 낮은 지연시간과 음성 벤치마크에서 높거나 대등한 품질을 제시했다. 모델은 인셉션 API로 제공되며 오픈AI API 호환 엔드포인트를 지원한다. 기존 음성 프레임워크나 자체 시스템의 언어모델 슬롯에 바로 연결할 수 있고, 일부 도입 사례에서는 전화 응답 지연시간 중앙값을 약 170ms까지 낮췄다.






