알리바바가 2026년 윈치대회(Apsara Conference)를 전후해 소개한 음성 모델은 **‘말을 듣는 즉시 통역하는 기술’**과 **‘음성을 인식하거나 새로운 소리를 만드는 기술’**로 나눠 보면 이해하기 쉽다. 실시간 통역은 Qwen3.8-LiveTranslate가, 음성 인식·합성·대화·오디오 제작은 Qwen-Audio-3.1의 모델 5종이 담당한다.
3
14
말이 끝나기 전에 통역하는 Qwen3.8-LiveTranslate
Qwen3.8-LiveTranslate는 발화가 들어오는 동안 번역 결과를 내놓는 동시통역 모델이다. 알리바바는 음성과 텍스트를 엮어 처리하는 ‘Interleave’ 구조를 통해 번역의 충실도·유창성·간결성을 높였다고 설명한다. 평균 번역 지연을 나타내는 지표인 LAAL은 약 2.8초에서 2.3초로, 0.5초가량 줄었다는 것이 회사 측 발표다. 약 18%의 감소폭이지만, 번역 품질과 속도 개선 모두 독립적으로 검증된 결과로 제시된 것은 아니다.
3
7
여러 사람이 말하는 상황을 위한 기능도 있다. 알리바바에 따르면 화자를 실시간으로 구분하고 원문과 번역문을 나란히 표시하며, 앞선 대화 내용을 활용해 뜻이 모호한 표현을 해석한다. 알리바바 클라우드의 모델 스튜디오 문서도 이 모델의 용도로 동시통역과 실시간 번역을 제시한다.
7
1
Qwen-Audio-3.1 모델 5종, 용도별로 보면
Qwen은 기존의 음성 인식(ASR), 음성 합성(TTS), 실시간 음성 대화(Realtime) 모델을 개선하고, ASR-Next와 TTS-Next를 새로 추가했다고 밝혔다. 이름은 비슷하지만 맡은 일은 다르다.
14
- Qwen-Audio-3.1-ASR: 사람의 말을 텍스트로 옮기는 음성 인식 모델이다.
14
26
- Qwen-Audio-3.1-ASR-Next: 받아쓰기를 넘어 화자를 표시하고 발화와 시간 정보를 맞춘다. Qwen은 감정과 말이 아닌 소리도 분석해 소리 설명이나 오디오 질의응답에 활용할 수 있다고 소개한다.
14
- Qwen-Audio-3.1-TTS: 텍스트를 음성으로 바꾼다. Qwen에 따르면 여러 언어와 방언을 지원하며 감정, 말하는 속도, 스타일을 조절할 수 있다.
14
- Qwen-Audio-3.1-Realtime: 사람과 주고받는 음성 대화를 위한 모델이다. 알리바바 클라우드는 음성 비서와 고객 상담 대화를 활용 사례로 제시한다.
14
1
- Qwen-Audio-3.1-TTS-Next: 음성만 읽어주는 데서 나아가 대사·효과음·배경음을 한 번에 생성한다. 텍스트, 시간 정보, 참고용 오디오 등을 입력으로 사용할 수 있다.
24
TTS와 TTS-Next의 차이는 ‘말소리 합성’과 ‘장면 전체의 소리 제작’에 있다. 알리바바는 TTS-Next를 오디오북, 영화·방송, 팟캐스트, 게임용 사운드스케이프 제작에 활용할 수 있다고 소개한다. 다만 이는 목표로 제시된 활용처이지, 생성된 결과물이 편집 없이 모든 제작 요건을 충족한다는 뜻은 아니다.
3
24