Qwen3.8 LiveTranslate vise l’interprétation simultanée. Alibaba annonce un décalage moyen ramené d’environ 2,8 à 2,3 secondes, sans validation indépendante citée.
Publié parModifié avec GPT-6 SolImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What audio models did Alibaba unveil at the 2026 Apsara Conference, and what are their capabilities and intended uses—including Qwen3.8-Live. Article summary: At the 2026 Apsara Conference, Alibaba presented Qwen3.8-LiveTranslate for simultaneous interpretation and its Qwen-Audio-3.1 lineup for speech recognition, synthesis, live interaction and audio creation. The reported tr. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
À l’occasion de la conférence Apsara 2026, Alibaba a présenté des modèles audio qui ne remplissent pas tous la même fonction. Qwen3.8-LiveTranslate sert à traduire une personne pendant qu’elle parle. Qwen-Audio 3.1 réunit cinq modèles destinés, selon le cas, à transcrire, comprendre, produire ou utiliser la voix dans une conversation. 3
14
Qwen3.8-LiveTranslate est conçu pour l’interprétation simultanée. Alibaba affirme que son architecture « Interleave » rend les traductions plus fidèles, plus fluides et plus concises. L’entreprise indique aussi que le LAAL, un indicateur du décalage moyen de traduction, passe d’environ 2,8 à 2,3 secondes : un gain de 0,5 seconde, soit près de 18 %. Il s’agit de résultats communiqués par Alibaba, et non de mesures indépendantes citées ici. 3
7
Pour les échanges à plusieurs, Alibaba décrit une identification des différents locuteurs en temps réel, un affichage synchronisé de l’original et de sa traduction, ainsi que l’utilisation du contexte précédent pour lever certaines ambiguïtés. La documentation de Model Studio, sa plateforme pour les développeurs, cite notamment l’interprétation simultanée et la traduction en direct parmi les usages du modèle. 7
1
La gamme comprend trois capacités mises à jour — ASR, TTS et Realtime — et deux nouveaux modèles, ASR-Next et TTS-Next. ASR désigne la reconnaissance automatique de la parole ; TTS, la conversion d’un texte en voix. 14
La distinction la plus nette concerne donc TTS-Next : on passe de la synthèse d’une voix à la création d’une scène sonore. Alibaba le destine notamment aux livres audio, au cinéma, à la télévision, aux podcasts et aux jeux vidéo. Ce sont des usages envisagés, pas la preuve qu’un résultat généré serait prêt à être diffusé sans retouche. 3
24
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Qwen3.8 LiveTranslate vise l’interprétation simultanée. Alibaba annonce un décalage moyen ramené d’environ 2,8 à 2,3 secondes, sans validation indépendante citée.
Qwen3.8 LiveTranslate vise l’interprétation simultanée. Alibaba annonce un décalage moyen ramené d’environ 2,8 à 2,3 secondes, sans validation indépendante citée. Les cinq modèles Qwen Audio 3.1 couvrent la transcription, l’analyse des sons, la synthèse vocale, la conversation en temps réel et la création d’ambiances audio.