Lançado em setembro de 2026 e disponível na plataforma Qwen AI, o modelo recebe texto, imagens, áudio e vídeo em um mesmo fluxo, com contexto de até 1 milhão de tokens. A Alibaba relata melhora média superior a 25% frente ao Qwen3.5 Omni Plus em 29 avaliações e menor consumo de tokens ao analisar vídeos longos de fo...
Publicado porEditado com GPT-6 SolImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8 Omni Flash, launched on the Qwen AI platform in September 2026, and how do its native text, image, audio, and vide. Article summary: Alibaba’s Qwen3.8 Omni Flash is a September 2026 model available on the Qwen AI platform that accepts text, images, audio, and video natively in one workflow, with a context window of up to 1 million tokens.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
O Qwen3.8-Omni-Flash é um modelo da Alibaba disponibilizado na plataforma Qwen AI em setembro de 2026. Ele recebe texto, imagens, áudio e vídeo de forma nativa em um mesmo fluxo e oferece uma janela de contexto de até 1 milhão de tokens — capacidade para manter uma grande quantidade de informações disponíveis durante uma tarefa. A proposta é que um agente de IA possa examinar o material, planejar os próximos passos, acionar ferramentas e entregar um resultado, em vez de apenas descrever o que recebeu. 1
2
16
Em uma reunião gravada, por exemplo, o modelo pode relacionar as falas às pessoas que aparecem no vídeo, separar os participantes e transcrever o conteúdo. Segundo a descrição do lançamento, ele aceita entradas audiovisuais de até uma hora nesse tipo de fluxo. Com ferramentas integradas ao agente, a análise pode servir de base para atas e tarefas posteriores. Isso não significa que toda reunião será processada sem erros ou que a janela de 1 milhão de tokens corresponda, por si só, a uma duração fixa de gravação. 52
2
Para vídeos longos, a ideia é procurar os trechos relevantes para a pergunta, em vez de analisar continuamente todos os quadros. A Alibaba relata consumo de 51,8% menos tokens que uma abordagem de compreensão estática no teste OmniVideoBench. Também informa uma melhora média de mais de 25% sobre o Qwen3.5-Omni-Plus em 29 avaliações. São resultados divulgados pela empresa em condições de teste, não uma promessa de economia ou desempenho idênticos em cada aplicação. 12
16
A Alibaba ampliou o Qwen-MM-Plugins, conjunto de componentes de código aberto destinado a acrescentar percepção de áudio e vídeo, uso de ferramentas e execução de tarefas prolongadas a estruturas de agentes. Separadamente, disponibilizou o Qwen-Live Harness, também de código aberto, para interações multimodais contínuas e em tempo real. O código aberto dessas ferramentas não deve ser confundido com a disponibilização dos pesos do modelo: o Qwen3.8-Omni-Flash é oferecido como serviço por API. 52
5
Há ainda uma variante Qwen3.8-Omni-Flash-Realtime, voltada a interações ao vivo com entrada de áudio e vídeo e respostas em texto e áudio. Sua documentação menciona áudio multicanal, agregação de vídeo e ferramentas remotas via MCP — protocolo usado para conectar agentes a ferramentas externas. 1
O custo é outra parte da aposta. A Alibaba afirma que o preço de entrada por hora na API caiu mais de 98% para áudio e mais de 93% para áudio e vídeo combinados. Somadas à análise seletiva, essas reduções podem facilitar agentes que precisam consultar gravações repetidas vezes. A conta final, porém, ainda depende do material enviado, dos tokens consumidos, das respostas geradas e das ferramentas acionadas. 12
16
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Lançado em setembro de 2026 e disponível na plataforma Qwen AI, o modelo recebe texto, imagens, áudio e vídeo em um mesmo fluxo, com contexto de até 1 milhão de tokens.
Lançado em setembro de 2026 e disponível na plataforma Qwen AI, o modelo recebe texto, imagens, áudio e vídeo em um mesmo fluxo, com contexto de até 1 milhão de tokens. A Alibaba relata melhora média superior a 25% frente ao Qwen3.5 Omni Plus em 29 avaliações e menor consumo de tokens ao analisar vídeos longos de forma seletiva.
Plugins para tarefas prolongadas, uma estrutura para interações ao vivo e reduções anunciadas nos preços de entrada de áudio e vídeo aproximam esses fluxos de aplicações práticas — sem garantir um custo fixo por tarefa.