O Qwen3.8 LiveTranslate traduz enquanto a pessoa fala; segundo a Alibaba, o atraso médio medido por LAAL caiu de cerca de 2,8 para 2,3 segundos. Os cinco modelos Qwen Audio 3.1 cobrem transcrição, síntese de voz, conversas em tempo real, compreensão de sons e criação de cenas sonoras.
Publicado porEditado com GPT-6 SolImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What audio models did Alibaba unveil at the 2026 Apsara Conference, and what are their capabilities and intended uses—including Qwen3.8-Live. Article summary: At the 2026 Apsara Conference, Alibaba presented Qwen3.8-LiveTranslate for simultaneous interpretation and its Qwen-Audio-3.1 lineup for speech recognition, synthesis, live interaction and audio creation. The reported tr. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Os anúncios de áudio da Alibaba ligados à conferência Apsara 2026 atendem a duas necessidades diferentes. O Qwen3.8-LiveTranslate interpreta uma fala enquanto ela acontece. Já a família Qwen-Audio-3.1 reúne cinco modelos para aplicações que precisam transcrever, gerar voz, conversar por áudio, analisar sons ou criar uma cena sonora completa. 3
14
O Qwen3.8-LiveTranslate foi desenvolvido para interpretação simultânea: ele produz a tradução à medida que recebe a fala, sem esperar o orador terminar. Segundo a Alibaba, a arquitetura Interleave melhora a fidelidade ao sentido original, a fluidez e a concisão da tradução. A empresa afirma ainda que o LAAL — uma medida do atraso médio da tradução — caiu de cerca de 2,8 para 2,3 segundos, uma redução de meio segundo, ou aproximadamente 18%. São resultados informados pela própria companhia, não uma avaliação independente. 3
7
Para conversas com várias pessoas, a Alibaba descreve recursos que distinguem os participantes em tempo real, exibem o texto original e o traduzido de forma sincronizada e usam o contexto anterior para esclarecer trechos ambíguos. A documentação da plataforma Model Studio aponta interpretação simultânea e tradução ao vivo como usos do modelo em tempo real. 7
1
A linha combina versões atualizadas de ASR, TTS e Realtime com dois novos modelos, ASR-Next e TTS-Next. ASR é reconhecimento de fala, ou seja, a conversão de voz em texto; TTS faz o caminho inverso, gerando voz a partir de texto. 14
A distinção mais importante para quem produz conteúdo está no TTS-Next: enquanto o TTS convencional transforma texto em fala, ele busca transformar um roteiro em uma cena sonora. A Alibaba aponta audiolivros, cinema e TV, podcasts e jogos como aplicações pretendidas. Isso descreve o objetivo da ferramenta — não garante que o áudio gerado dispense edição antes de ser publicado. 3
24
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
O Qwen3.8 LiveTranslate traduz enquanto a pessoa fala; segundo a Alibaba, o atraso médio medido por LAAL caiu de cerca de 2,8 para 2,3 segundos.
O Qwen3.8 LiveTranslate traduz enquanto a pessoa fala; segundo a Alibaba, o atraso médio medido por LAAL caiu de cerca de 2,8 para 2,3 segundos. Os cinco modelos Qwen Audio 3.1 cobrem transcrição, síntese de voz, conversas em tempo real, compreensão de sons e criação de cenas sonoras.