Modellen finns på Qwen AI plattformen och tar emot text, bilder, ljud och video, med ett kontextfönster på upp till en miljon token. Alibaba uppger drygt 25 procent högre genomsnittligt resultat än Qwen3.5 Omni Plus i 29 utvärderingar.
Publicerad avRedigerad med GPT-6 SolBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8 Omni Flash, launched on the Qwen AI platform in September 2026, and how do its native text, image, audio, and vide. Article summary: Alibaba’s Qwen3.8 Omni Flash is a September 2026 model available on the Qwen AI platform that accepts text, images, audio, and video natively in one workflow, with a context window of up to 1 million tokens.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
Alibaba lanserade Qwen3.8-Omni-Flash i september 2026. Modellen finns på Qwen AI-plattformen och kan ta emot text, bilder, ljud och video i samma arbetsflöde. Kontextfönstret är på upp till en miljon token – de enheter som modellen använder för att hantera indata. Tanken är att en AI-agent ska kunna förstå blandat material, välja nästa steg och använda verktyg för att lösa en uppgift, inte bara beskriva vad den ser och hör. Den vanliga Flash-modellen ger text som svar; ljudutmatning hör till den separata Realtime-varianten. 1
2
5
16
Vid analys av en lång video kan agenten leta upp de avsnitt som är relevanta för frågan i stället för att bearbeta varje bildruta löpande. Alibaba uppger att metoden använde 51,8 procent färre token än statisk analys i testet OmniVideoBench. Företaget rapporterar också ett genomsnittligt resultat som är mer än 25 procent bättre än Qwen3.5-Omni-Plus i 29 utvärderingar. Det är testresultat, inte ett löfte om samma förbättring eller besparing i varje tillämpning. 12
16
Det stora kontextfönstret är även avsett för längre uppgifter med blandat material. Modellen uppges kunna hantera upp till en timmes ljud och video från ett möte, koppla röster till personer i bild och transkribera det som sägs. Med verktyg kan ett sådant arbetsflöde gå vidare från att hitta viktiga delar av inspelningen till att exempelvis sammanställa mötesanteckningar och uppgifter att följa upp. 2
52
De utökade Qwen-MM-Plugins ska hjälpa agentmiljöer att använda modellens ljud- och videofunktioner i längre arbetsflöden. Det separat öppna Qwen-Live Harness är avsett för löpande interaktion. Varianten Qwen3.8-Omni-Flash-Realtime stöder direkt interaktion med ljud och video, svar i text och ljud samt flerkanaligt ljud, sammanföring av videoströmmar och fjärranslutna MCP-verktyg. MCP är ett gränssnitt för att ansluta externa verktyg. Att dessa stödverktyg är öppna innebär inte att själva modellens vikter har släppts öppet. 1
5
52
Alibaba uppger att API-kostnaden per timmes ljudinmatning har sjunkit med mer än 98 procent och per timmes kombinerad ljud- och videoinmatning med mer än 93 procent. Tillsammans med selektiv videoanalys kan det göra agentuppgifter som återkommande granskar inspelningar mer ekonomiskt rimliga. Den faktiska kostnaden beror fortfarande på hur mycket material och hur många token som behandlas, vilka svar som skapas och vilka verktyg som används. 12
16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Modellen finns på Qwen AI plattformen och tar emot text, bilder, ljud och video, med ett kontextfönster på upp till en miljon token.
Modellen finns på Qwen AI plattformen och tar emot text, bilder, ljud och video, med ett kontextfönster på upp till en miljon token. Alibaba uppger drygt 25 procent högre genomsnittligt resultat än Qwen3.5 Omni Plus i 29 utvärderingar.
Selektiv analys av lång video och lägre uppgivna kostnader för ljud och videoinmatning kan göra återkommande agentuppgifter billigare, men utfallet beror på användningen.