Qwen3.8 Omni Flash acepta texto, imágenes, audio y vídeo de forma nativa y está disponible en la plataforma Qwen AI. Alibaba afirma que supera en más de un 25 % a Qwen3.5 Omni Plus de media en 29 evaluaciones; son resultados comunicados por la compañía, no una garantía para cada uso.
Publicado porEditado con GPT-6 SolImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8 Omni Flash, launched on the Qwen AI platform in September 2026, and how do its native text, image, audio, and vide. Article summary: Alibaba’s Qwen3.8 Omni Flash is a September 2026 model available on the Qwen AI platform that accepts text, images, audio, and video natively in one workflow, with a context window of up to 1 million tokens.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
Una reunión grabada no plantea una sola tarea: hay que identificar quién habla, relacionar las voces con las imágenes, localizar acuerdos y, quizá, preparar una lista de pendientes. Qwen3.8-Omni-Flash, presentado por Alibaba en septiembre de 2026 y disponible en Qwen AI, está diseñado para reunir ese trabajo en un flujo que admite texto, imágenes, audio y vídeo de forma nativa. Su ventana de contexto llega a un millón de tokens. El modelo principal devuelve texto; la variante Realtime incorpora salida de audio. 2
5
1
La propuesta es que un agente pueda examinar materiales de distintos formatos, razonar sobre lo que encuentra y utilizar herramientas para entregar un resultado, en lugar de limitarse a describir el contenido. En reuniones de hasta una hora de audio y vídeo, el modelo puede relacionar participantes y voces, separar intervenciones y transcribirlas; ese análisis puede servir de base para actas y tareas posteriores. 16
52
Para vídeos largos, el procesamiento selectivo permite buscar los momentos pertinentes en vez de analizar continuamente cada fotograma. Alibaba comunica un uso de un 51,8 % menos de tokens que un método de comprensión estática en OmniVideoBench. También informa de una mejora media superior al 25 % frente a Qwen3.5-Omni-Plus en 29 evaluaciones. Son mediciones de pruebas concretas: ni la precisión ni el ahorro tienen por qué repetirse en todos los proyectos. 12
16
Alibaba amplió Qwen-MM-Plugins para incorporar capacidades de audio y vídeo a entornos de agentes que ejecutan tareas de varios pasos. Por separado, publicó como código abierto Qwen-Live Harness, orientado a interacciones continuas en tiempo real. La variante Qwen3.8-Omni-Flash-Realtime admite interacción en directo con audio y vídeo, respuestas en texto y audio, audio multicanal, agregación de vídeo y herramientas remotas mediante MCP, un protocolo para conectar agentes con herramientas externas. 52
1
2
El otro factor es el precio. Según Alibaba, el coste de la API por hora de entrada de audio baja más del 98 %, y el de entrada conjunta de audio y vídeo, más del 93 %. Sumadas al análisis selectivo, esas rebajas pueden hacer más viables los agentes que revisan grabaciones y usan herramientas de forma recurrente. El coste final, sin embargo, dependerá del material procesado, los tokens consumidos, las respuestas generadas y las herramientas utilizadas. 12
16
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Qwen3.8 Omni Flash acepta texto, imágenes, audio y vídeo de forma nativa y está disponible en la plataforma Qwen AI.
Qwen3.8 Omni Flash acepta texto, imágenes, audio y vídeo de forma nativa y está disponible en la plataforma Qwen AI. Alibaba afirma que supera en más de un 25 % a Qwen3.5 Omni Plus de media en 29 evaluaciones; son resultados comunicados por la compañía, no una garantía para cada uso.
El análisis selectivo de vídeos largos y las rebajas de más del 98 % en el coste por hora de entrada de audio y de más del 93 % en audio y vídeo pueden facilitar proyectos con agentes multimodales.