알리바바는 23일 차세대 전이중 음성 모델 ‘큐원-오디오-3.1-리얼타임’을 공개했다. 이 모델은 사용자의 말을 듣고 답하는 수준을 넘어, 언제 기다리고 언제 응답할지까지 판단하도록 설계됐다. 전이중 방식이라 사용자의 발화를 들으면서도 주변 음성을 함께 파악할 수 있다. 여러 차례 이어지는 지시, 공감형 대화, 역할극, 다자 대화와 다국어 대화도 지원한다. 특히 주변 소음이나 다른 사람의 말을 구분하고, 사용자가 말을 마칠 때까지 기다리거나 중간 발화를 인식해 대화를 이어가는 기능을 강화했다.
구조는 ‘생각하고, 행동하고, 말하고 조율하는’ 3단계 학습으로 설명됐다. 먼저 음성을 문자 입력이 아닌 대화 맥락으로 이해하도록 학습하고, 다음으로 데이터베이스와 도구를 써서 요청을 처리하는 방식을 익힌다. 마지막 단계에서는 무엇을 말할지뿐 아니라 언제 말할지도 결정한다. 자체 평가에서는 이전 버전보다 음성 작업 성공률이 78.4%에서 82.0%로 올랐고, 주변 대화에 잘못 반응하는 비율은 73.0%에서 13.0%로 낮아졌다. 이 모델은 현재 큐원클라우드의 관리형 API로 제공되며 웹소켓, 함수 호출, 웹 검색, 구조화된 출력, 컨텍스트 캐시를 지원한다.






