Modellen er tilgjengelig på Qwen AI plattformen og tar imot tekst, bilder, lyd og video direkte, med et kontekstvindu på opptil én million tokener. Alibaba oppgir over 25 prosent bedre gjennomsnittsresultat enn Qwen3.5 Omni Plus på 29 evalueringer.
Publisert avRedigert med GPT-6 SolBilder generert med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8 Omni Flash, launched on the Qwen AI platform in September 2026, and how do its native text, image, audio, and vide. Article summary: Alibaba’s Qwen3.8 Omni Flash is a September 2026 model available on the Qwen AI platform that accepts text, images, audio, and video natively in one workflow, with a context window of up to 1 million tokens.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
En time med møteopptak kan romme både samtaler, presentasjoner og hendelser som bare vises på skjermen. Qwen3.8-Omni-Flash er Alibabas forsøk på å la én KI-modell forstå slikt materiale samlet og deretter bruke verktøy til å gjøre noe med det. Modellen ble lansert i september 2026, er tilgjengelig på Qwen AI-plattformen og tar imot tekst, bilder, lyd og video direkte. Kontekstvinduet er på opptil én million tokener – enheter modellen bruker til å behandle innhold. Grunnmodellen leverer tekst som svar. 1
2
5
Poenget er ikke bare å beskrive en video. I en arbeidsflyt kan en KI-agent lete etter relevant tale eller bestemte øyeblikk i opptaket, vurdere funnene og bruke verktøy for å lage et resultat. Modellen støtter blant annet møteopptak med lyd og bilde på opptil én time, der den kan skille mellom talere, transkribere innhold og knytte stemmer til personene på skjermen. 16
52
For lange videoer kan agenten undersøke utvalgte deler fremfor å behandle alt fortløpende. Alibaba rapporterer 51,8 prosent færre tokener ved slik selektiv behandling enn ved statisk videoforståelse i testen OmniVideoBench. Selskapet oppgir også at modellen i gjennomsnitt scorer over 25 prosent bedre enn forgjengeren Qwen3.5-Omni-Plus på 29 evalueringer. Dette er rapporterte testresultater, ikke et løfte om samme effekt i enhver bruk. 12
16
Alibaba har utvidet de åpne Qwen-MM-Plugins for å gi agentrammeverk tilgang til lyd- og videofunksjoner i lengre arbeidsflyter. Det separat utgitte rammeverket Qwen-Live Harness er åpen kildekode og retter seg mot løpende samhandling. En egen Realtime-variant støtter direkte lyd- og videoinndata, svar som tekst og lyd, flerkanalslyd, sammenstilling av video og eksterne MCP-verktøy. Disse sanntidsfunksjonene må ikke forveksles med tekstutdataene fra grunnmodellen. 1
5
52
Ifølge Alibaba har API-kostnaden per time falt med over 98 prosent for lydinndata og over 93 prosent for kombinert lyd- og videoinndata. Sammen med selektiv videobehandling kan det gjøre agenter som stadig må lytte, se og bruke verktøy, rimeligere å drive. Den faktiske kostnaden vil likevel avhenge av hva som behandles, hvor mange tokener som brukes, hvilke svar som produseres, og hvilke verktøy arbeidsflyten benytter. 12
16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Modellen er tilgjengelig på Qwen AI plattformen og tar imot tekst, bilder, lyd og video direkte, med et kontekstvindu på opptil én million tokener.
Modellen er tilgjengelig på Qwen AI plattformen og tar imot tekst, bilder, lyd og video direkte, med et kontekstvindu på opptil én million tokener. Alibaba oppgir over 25 prosent bedre gjennomsnittsresultat enn Qwen3.5 Omni Plus på 29 evalueringer.
Utvidede Qwen MM Plugins og Qwen Live Harness skal støtte henholdsvis langvarige arbeidsflyter og direkte samhandling.