Qwen3.8 Flash Next ble lansert 26. august 2026 som en åpen, multimodal teknisk forhåndsvisning av Qwen4 – med 125 milliarder hovedparametre, men bare rundt 6 milliarder aktive per token.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Alibaba- og Qwen-teamet lanserte Qwen3.8-Flash-Next 26. august 2026, med mer omtale dagen etter. Den åpne modellen er ikke den ferdige toppmodellen Qwen4. I stedet presenteres den som en tidlig og etterprøvbar forhåndsvisning av arkitekturen Qwen planlegger å bruke i Qwen4-familien. 1
2
15
Det mest oppsiktsvekkende er kombinasjonen av stor total kapasitet og lav beregningskostnad per token: Modellen har et hovednettverk på 125 milliarder parametre, i tillegg til en N-gram-embeddingmodul på 51 milliarder parametre, men aktiverer bare rundt 6 milliarder parametre for hvert token. Målet er å beholde kapasiteten til en stor modell uten å betale full beregningspris for hvert eneste ord eller bildepunkt. 4
15
Navnet Qwen3.8-Flash-Next viser til den åpne modellen Qwen har publisert. Qwen3.8-Flash brukes om den produksjonsrettede modellen og API-tjenesten, mens «Next»-varianten er den åpne forhåndsvisningen av arkitekturen. Rapporteringen beskriver den som et multimodalt mixture-of-experts-system, eller MoE, bygget rundt teknologi som er planlagt for Qwen4. 1
2
15
Forskjellen er viktig: Qwen3.8-Flash-Next er best forstått som et teknisk veikart og en utviklerplattform, ikke som et bevis på at hele Qwen4-familien allerede er lansert. Ved å slippe vektene tidlig får forskere og utviklere mulighet til å undersøke designet, tilpasse verktøy og gi tilbakemeldinger før den bredere modellserien kommer. 2
3
15
Én million token er ikke modellens innebygde kontekstgrense. Den ordinære konfigurasjonen er spesifisert til 262 144 token; den større konteksten avhenger av YaRN-utvidelsen og bør derfor vurderes som en utvidet konfigurasjon. 1
4
16
Qwen3.8-Flash-Next kombinerer Gated DeltaNet, forkortet GDN, med Qwen Sparse Attention, eller QSA. GDN skal komprimere informasjon fra tidligere deler av konteksten. QSA bruker på sin side en lettvektsindeks for å finne og velge relevante mikroområder, i stedet for å beregne full oppmerksomhet over hele historikken hver gang. 4
Tanken er å gjøre kjøring med lange kontekster mindre kostbar og mindre treg etter hvert som sekvensene vokser. Qwen oppgir opptil 7,6 ganger raskere prefill – innlesing av konteksten – og 4,9 ganger raskere dekoding på sekvenser med én million token. Tallene er rapportert av Qwen selv og avhenger blant annet av maskinvare, implementasjon, sekvenslengde og testoppsett. De bør derfor ikke tolkes som universelle resultater i produksjon. 4
Den separate N-gram-komponenten tilfører modellen representasjonskapasitet, samtidig som bare en begrenset del av parameterne må behandles aktivt for hvert token. Qwen beskriver også støtte for å legge embedding-tabellen i vertsminnet og hente inn data asynkront, slik at dataoverføring kan overlappe med selve modellberegningen. 4
For dem som drifter store modeller, er dette en praktisk viktig retning. Hvor data ligger i minnet, og hvor mye som må flyttes, kan være like avgjørende som det totale antallet parametre – særlig ved analyse av lange dokumenter eller store batchjobber.
Forhåndsvisningen inneholder dessuten endringer i optimalisering og skalering. Qwen oppgir at teamet bruker Muon-optimalisatoren, har justert samspillet med AdamW og parameterhåndteringen, og har tilpasset en ny skaleringlov for modelltypen. 4
Dette gjør lanseringen til mer enn et nytt sjekkpunkt med en annen oppmerksomhetsmekanisme. Den fungerer som en offentlig test av en bredere oppskrift for å bygge modeller med stor samlet kapasitet, men relativt lav aktiv beregning.
Qwen sier at treningen av Qwen3.8-Flash krevde omtrent en niendedel av kostnaden for Qwen3.7-Plus, samtidig som modellen forbedret resultater innen programmering og kontoroppgaver. Reuters rapporterte uavhengig om selskapets påstander om sterkere resultater på disse områdene og lavere treningskostnader. 1
4
Lanseringsmaterialet viser til resultater på 58,7 i DeepSWE 1.1, 62,5 i SWE-bench Pro og 84,5 i AndroidWorld. Qwen plasserer disse resultatene foran DeepSeek V4 Flash i verdisegmentet. Sammenligningene er imidlertid oppgitt av selskapet; materialet som er tilgjengelig her, dokumenterer ikke at de er gjenskapt uavhengig under identiske testforhold. 4
Den oppgitte API-prisen for produksjonsmodellen Qwen3.8-Flash er 1 yuan per million input-token og 3 yuan per million output-token. Lanseringsmaterialet beskriver ikke noe skille mellom rushtid og lavtrafikk. Pris sammenlignet med andre modeller vil likevel avhenge av modellversjon, hurtigbuffering, kontekstlengde, tjenestenivå og hvor omfattende svarene må være. 1
4
De åpne vektene gjør Qwen3.8-Flash-Next til en plattform for eksperimentering før Qwen4 kommer. Utviklere kan begynne å tilpasse inferensverktøy, teste kvantisering og serveroppsett og undersøke hvordan arkitekturen fungerer på egne arbeidslaster – uten å vente på en ferdig Qwen4-implementasjon. 2
3
15
Modellen er særlig relevant for oppgaver der kontekstlengde eller kostnad per token er en flaskehals, blant annet:
Dette er bruksområder som følger naturlig av modellens lange kontekst og lave andel aktive parametre. Det er ikke en garanti for at modellen vil slå alle tette modeller eller modeller med full oppmerksomhet i produksjon. Maskinvare, serverprogramvare, kvantiseringskvalitet, bruk av informasjonsgjenfinning og sammensetningen av arbeidslasten vil avgjøre den faktiske økonomien.
Qwen3.8-Flash-Next er interessant fordi Alibaba viser fram en ny arkitektonisk retning tidlig. Modellen gir utviklermiljøet en konkret måte å undersøke om sparsom og komprimert oppmerksomhet, store hjelpe-embeddings og få aktive parametre kan gi bedre økonomi ved svært lange kontekster uten uakseptable kvalitetsfall.
Samtidig kommer de mest oppsiktsvekkende tallene – blant annet hastighetsøkninger, testledelse, lavere treningskostnader og påstander om konkurransedyktig verdi – i hovedsak fra Qwen eller fra omtale basert på Qwens egne opplysninger. Det trengs uavhengige tester på tvers av maskinvare, språk, kontekstlengder, multimodale oppgaver og agentbaserte produksjonsflyter.
Den mest presise konklusjonen er derfor ikke at «Qwen3.8-Flash-Next slår alle konkurrentene». Det er en åpen, multimodal MoE-forhåndsvisning som gir utviklere et uvanlig tidlig innblikk i systemarkitekturen Alibaba forbereder for Qwen4 – og et konkret, testbart veikart mot mer effektiv kunstig intelligens med svært lange kontekster.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen3.8 Flash Next ble lansert 26. august 2026 som en åpen, multimodal teknisk forhåndsvisning av Qwen4 – med 125 milliarder hovedparametre, men bare rundt 6 milliarder aktive per token.
Qwen3.8 Flash Next ble lansert 26. august 2026 som en åpen, multimodal teknisk forhåndsvisning av Qwen4 – med 125 milliarder hovedparametre, men bare rundt 6 milliarder aktive per token. Modellen kombinerer Gated DeltaNet og Qwen Sparse Attention for å håndtere svært lange kontekster mer effektivt, med en innebygd kontekst på 262 144 token og støtte for opptil én million token via YaRN.
Qwen oppgir lavere treningskostnader, sterke resultater i kode og agenttester og opptil 7,6 ganger raskere innmating av én million token – men tallene er i hovedsak leverandørrapporterte og må etterprøves uavhengig.