Qwen3.8 Flash Next blev udgivet 26. august 2026 som en åben, multimodal teknisk preview model for arkitekturen, der skal danne grundlag for Qwen4.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Alibaba Qwen udgav Qwen3.8-Flash-Next den 26. august 2026, og omtalen fulgte dagen efter. Modellen er ikke lanceret som den endelige flagskibsmodel i Qwen4-serien. Den er snarere et åbent og inspicerbart preview af den arkitektur, som Qwen siger skal ligge til grund for Qwen4. 1
2
15
Det særlige ved udgivelsen er forholdet mellem samlet kapacitet og aktiv beregning: Hovedmodellen har 125 milliarder parametre, mens et separat N-gram-embedding-modul tilføjer yderligere 51 milliarder. Alligevel aktiveres kun omkring 6 milliarder parametre pr. token. Ideen er at bevare en stor models repræsentationskapacitet uden at betale den fulde beregningspris for hvert eneste token. 4
15
Navnet Qwen3.8-Flash-Next dækker den åbne model, som Qwen har frigivet til udviklere. Qwen3.8-Flash bruges derimod om den produktionsorienterede model og API-tilbuddet. Rapporteringen beskriver Next-udgaven som et multimodalt mixture-of-experts-system, eller MoE, bygget omkring teknologi, der er planlagt til Qwen4. 1
2
15
Forskellen er vigtig: Qwen3.8-Flash-Next er bedst forstået som en teknisk prøve og en slags udviklerblåkopi – ikke som dokumentation for, at hele Qwen4-familien allerede er lanceret. Ved at åbne vægtene tidligt giver Qwen forskere og udviklere mulighed for at undersøge designet, tilpasse værktøjer og komme med feedback, før den bredere modelserie kommer. 2
3
15
Tallet på 1 million tokens skal ikke forveksles med modellens indbyggede kontekstgrænse. Den normale konfiguration angiver 262.144 tokens, mens det større vindue kræver YaRN-udvidelse og derfor bør vurderes som en særskilt, udvidet konfiguration. 1
4
16
Qwen3.8-Flash-Next kombinerer Gated DeltaNet (GDN) med Qwen Sparse Attention (QSA). GDN er udviklet til at komprimere information fra den tidligere kontekst, mens QSA bruger et letvægtsindeks til at finde og udvælge relevante mikroblokke i stedet for at anvende fuld attention ensartet på hele historikken. 4
Målet er at gøre inferens med lange kontekster mindre dyr og mindre langsom, efterhånden som sekvenserne vokser. Qwen rapporterer op til 7,6 gange hurtigere prefill og 4,9 gange hurtigere decoding ved sekvenser på 1 million tokens. Tallene er leverandørrapporterede og afhænger blandt andet af hardware, implementering, sekvenslængde og benchmarkopsætning. De kan derfor ikke læses som universelle resultater for alle installationer. 4
Det separate N-gram-embedding-modul tilfører modellen ekstra repræsentationskapacitet, samtidig med at kun en mindre del af de samlede parametre skal behandles aktivt for hvert token. Qwens design understøtter også, at embedding-tabellen kan flyttes til værtsmaskinens hukommelse, mens data hentes asynkront, så dataoverførsel kan foregå parallelt med modelberegningen. 4
For dem, der driver store modeller, er det en vigtig praktisk retning. Placering af hukommelse og flytning af data kan have lige så stor betydning som det rå parametertal – især ved lange dokumenter og batchjobs med mange forespørgsler.
Previewet omfatter desuden ændringer i optimering og skalering. Qwen oplyser, at teamet har brugt Muon-optimeren, justeret samspillet med AdamW og ændret håndteringen af parametre. Derudover er der tilpasset en ny scaling law til modeldesignet. 4
Udgivelsen er derfor mere end et modelcheckpoint med en ny attention-blok. Den fungerer som en offentlig afprøvning af en bredere opskrift på modeller, der kombinerer stor samlet kapacitet med relativt lav aktiv beregning.
Qwen siger, at træningen af Qwen3.8-Flash krævede omkring en niendedel af omkostningerne ved Qwen3.7-Plus, samtidig med at modellen forbedrede resultaterne inden for kodning og kontoropgaver. Reuters rapporterede uafhængigt om virksomhedens oplysninger om stærkere resultater på netop disse områder og lavere træningsomkostninger. 1
4
I udgivelsesmaterialet nævnes resultater på 58,7 i DeepSWE 1.1, 62,5 i SWE-bench Pro og 84,5 i AndroidWorld. Qwen positionerer resultaterne foran DeepSeek V4 Flash i værdisegmentet. Sammenligningerne kommer dog fra virksomheden selv; det tilgængelige materiale dokumenterer ikke, at de er blevet uafhængigt reproduceret under identiske evalueringsforhold. 4
Den oplyste API-pris for den produktionsrettede Qwen3.8-Flash er 1 yuan pr. million inputtokens og 3 yuan pr. million outputtokens. Udgivelsesmaterialet beskriver ingen forskel mellem spidsbelastning og lavbelastning. Direkte prissammenligninger med andre modeller afhænger fortsat af blandt andet modelversion, caching, kontekstlængde, serviceniveau og krav til output. 1
4
De åbne vægte gør Qwen3.8-Flash-Next interessant som platform for eksperimenter, før Qwen4 kommer. Udviklere kan begynde at tilpasse inferensværktøjer, afprøve kvantisering og servering samt undersøge, hvordan arkitekturen klarer deres egne arbejdsbelastninger – i stedet for at vente på en færdig Qwen4-implementering. 2
3
15
Designet er særligt relevant for opgaver, hvor kontekstlængde eller tokenøkonomi er en begrænsning, eksempelvis:
Det er oplagte anvendelser ud fra modellens langkontekst- og aktiv-parameterdesign – ikke en garanti for, at den slår alle tætte modeller eller modeller med fuld attention i produktion. Den faktiske økonomi vil blandt andet afhænge af hardware, serversoftware, kvantiseringskvalitet, retrieval-strategi og arbejdsbelastningens sammensætning.
Qwen3.8-Flash-Next er betydelig, fordi den viser en mulig arkitektonisk retning tidligt og konkret. Forskere og udviklere kan teste, om sparse og komprimeret attention, store hjælpe-embeddings og få aktive parametre faktisk kan give bedre økonomi ved meget lange kontekster uden uacceptable kvalitetstab.
De mest opsigtsvækkende tal – hastighedsforbedringer, benchmarkførerskab, lavere træningsomkostninger og påstået værdi i forhold til konkurrenterne – stammer dog i vid udstrækning fra Qwen eller fra rapportering baseret på Qwens oplysninger. Der er stadig brug for uafhængige tests på tværs af hardware, sprog, kontekstlængder, multimodale opgaver og agentforløb i produktion.
Den mest holdbare konklusion er derfor smallere end, at Qwen3.8-Flash-Next skulle slå alle konkurrerende modeller. Det er et åbent, multimodalt MoE-teknisk preview, som giver udviklerfællesskabet et usædvanligt tidligt indblik i den systemarkitektur, Alibaba forbereder til Qwen4 – og en konkret, testbar plan for at gøre AI med meget lange kontekster mere effektiv.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen3.8 Flash Next blev udgivet 26. august 2026 som en åben, multimodal teknisk preview model for arkitekturen, der skal danne grundlag for Qwen4.
Qwen3.8 Flash Next blev udgivet 26. august 2026 som en åben, multimodal teknisk preview model for arkitekturen, der skal danne grundlag for Qwen4. Modellen kombinerer 125 milliarder parametre i hovednetværket med yderligere 51 milliarder N gram embeddings, men aktiverer kun omkring 6 milliarder parametre pr.
Den har et indbygget kontekstvindue på 262.144 tokens, som kan udvides til 1 million tokens med YaRN.