알리바바는 18일(현지시간) 실시간 통번역 모델 '큐원3.8-라이브트랜스레이트(Qwen3.8-LiveTranslate)'를 공개했다. 이 모델은 대화 중 음성이 끝날 때까지 기다리지 않고, 듣는 동시에 번역문과 번역 음성을 생성한다. 평균 지연 시간을 나타내는 LAAL은 기존 2.8초에서 2.3초로 줄었다.

핵심 구조는 오디오와 텍스트를 하나의 흐름으로 묶는 '인터리브' 아키텍처다. 입력 음성을 문자로 바꾼 뒤 다시 번역하는 별도 음성인식 단계를 거치지 않고, 하나의 통합된 처리 흐름에서 통역을 수행한다. 알리바바는 이 방식으로 이전 세대보다 통역의 충실도와 유창성, 간결성을 높였다고 설명했다.

이 모델은 60개 언어의 음성 입력과 텍스트 번역을 지원한다. 이 가운데 한국어, 영어, 중국어, 일본어를 포함한 29개 언어는 번역 음성 출력도 제공한다. 여러 사람이 말하는 상황에서는 화자 분리 기능으로 발화자를 구분해 표시하고, 번역 음성에서도 각 화자의 음색을 유지하도록 설계됐다. 원문과 번역문을 함께 보여주는 이중 언어 동기화 출력, 앞선 대화 맥락을 반영해 이름과 전문용어 번역의 일관성을 높이는 기능, 영상 정보를 함께 활용하는 입력 방식도 포함됐다.

아키텍처는 '싱커-토커'의 2개 모듈로 구성된다. 싱커는 영상과 오디오, 원문, 번역문을 시간 순서에 따라 하나의 시퀀스로 처리하고, 토커는 원음과 번역 결과를 결합해 원래 화자의 음색을 살린 번역 음성을 만든다. 알리바바는 공개 음성 테스트셋 'FLEURS' 70개 언어 평가에서 이전 세대와 주요 실시간 통역 시스템보다 번역 품질, 지연시간, 음성인식 정확도, 음성합성 품질에서 앞섰다고 밝혔다. 개발자는 알리바바 클라우드의 모델 스튜디오와 큐원클라우드에서 웹소켓 기반 API로 이 모델을 사용할 수 있다.