음성 AI에 대한 투자와 제품 출시는 빠르게 늘고 있다. 모델 개발사부터 기업 고객센터, 회의 기록, 받아쓰기 도구까지 적용 범위도 넓어졌다. 하지만 업계에서는 기술이 아직 결정적 전환점에 도달하지 않았다는 평가가 나왔다. PolyAI의 CTO Shawn Wen은 상대 말을 들으면서 동시에 말할 수 있는 full-duplex 모델이 등장했지만, 다음 과제는 추론을 매우 빠르게 만들어 답을 즉시 찾고 대화를 더 자연스럽게 이어가는 일이라고 말했다. 고객 서비스용 AI 에이전트도 기계적으로 들리지 않아야 하며, 몇 차례 대화 안에 문제를 해결할 수 있다는 신뢰를 줘야 한다고 설명했다.

회의 기록 서비스 영역에서도 비슷한 기준이 제시됐다. Otter의 Alex Gay는 자동화를 위해서는 화자 구분, 의도 파악, 그리고 이를 조직의 지식과 연결해 문서화하는 과정이 중요하다고 말했다. 회사는 회의에서 사람을 대신할 수 있는 디지털 트윈도 개발 중이며, 이 경우 단순히 말을 읽는 수준이 아니라 사람과 대화할 때처럼 감정이 실린 음성 표현이 필요하다고 봤다. 핵심은 음성이 사람처럼 들리는 데서 끝나지 않고, 빠른 이해와 맥락 처리, 신뢰 형성이 함께 갖춰져야 실제 업무 인터페이스로 자리 잡는다는 점이다.