Alibaba presentó Qwen3.8 LiveTranslate para interpretación simultánea y una familia de cinco modelos Qwen Audio 3.1 con funciones distintas. Según la empresa, la latencia media de traducción medida con LAAL bajó de unos 2,8 a 2,3 segundos; no se trata de un resultado verificado de forma independiente.
Publicado porEditado con GPT-6 SolImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What audio models did Alibaba unveil at the 2026 Apsara Conference, and what are their capabilities and intended uses—including Qwen3.8-Live. Article summary: At the 2026 Apsara Conference, Alibaba presented Qwen3.8-LiveTranslate for simultaneous interpretation and its Qwen-Audio-3.1 lineup for speech recognition, synthesis, live interaction and audio creation. The reported tr. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Los anuncios de audio de Alibaba en torno a Apsara 2026 responden a dos necesidades diferentes. Qwen3.8-LiveTranslate busca traducir una intervención mientras la persona sigue hablando. Qwen-Audio-3.1 reúne cinco modelos para reconocer voz, comprender grabaciones, sintetizar habla, mantener conversaciones por voz y crear piezas de audio. 3
14
Qwen3.8-LiveTranslate está diseñado para la interpretación simultánea. Alibaba atribuye a su arquitectura Interleave mejoras en la fidelidad, la fluidez y la concisión de la traducción. También afirma que la latencia media medida mediante LAAL, un indicador del retraso de la traducción, pasó de unos 2,8 a 2,3 segundos: medio segundo menos, aproximadamente un 18 %. Son cifras y mejoras comunicadas por la empresa, no resultados de pruebas independientes. 3
7
Para conversaciones con varias personas, Alibaba describe la identificación de hablantes en tiempo real, la presentación sincronizada del texto original y su traducción, y el uso del contexto previo para interpretar expresiones ambiguas. La documentación de Model Studio, la plataforma de modelos de Alibaba Cloud, incluye la interpretación simultánea y la traducción en vivo entre los usos del modelo. 7
1
Qwen presenta Audio 3.1 como la actualización de tres capacidades —ASR, TTS y Realtime— y la incorporación de dos modelos nuevos, ASR-Next y TTS-Next. Las siglas ayudan a distinguirlos: ASR se refiere al reconocimiento automático del habla y TTS, a la conversión de texto en voz. 14
La diferencia práctica entre TTS y TTS-Next es que el primero sintetiza habla, mientras que el segundo apunta a construir una escena sonora. Alibaba propone esta última capacidad para audiolibros, cine y televisión, pódcast y videojuegos. Son usos previstos por la empresa, no una garantía de que el audio generado pueda incorporarse a una producción sin edición. 3
24
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Alibaba presentó Qwen3.8 LiveTranslate para interpretación simultánea y una familia de cinco modelos Qwen Audio 3.1 con funciones distintas.
Alibaba presentó Qwen3.8 LiveTranslate para interpretación simultánea y una familia de cinco modelos Qwen Audio 3.1 con funciones distintas. Según la empresa, la latencia media de traducción medida con LAAL bajó de unos 2,8 a 2,3 segundos; no se trata de un resultado verificado de forma independiente.
TTS Next puede generar voces, efectos y sonido ambiental en una sola pasada, una capacidad orientada a la producción de contenidos.