Qwen3.8 Flash Next släpptes den 26 augusti 2026 som en öppen, multimodal förhandsvisning av arkitekturen bakom Qwen4. Modellen har 125 miljarder parametrar i huvudnätverket och ytterligare 51 miljarder i N gram inbäddningar, men aktiverar bara cirka 6 miljarder parametrar per token.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Alibaba och AI-teamet Qwen släppte Qwen3.8-Flash-Next den 26 augusti 2026, med ytterligare rapportering dagen därpå. Modellen är inte den färdiga flaggskeppsmodellen Qwen4. I stället beskrivs den som en öppen och inspekterbar teknikförhandsvisning av arkitekturen som ska ligga till grund för Qwen4-familjen. 1
2
15
Det mest uppseendeväckande är kombinationen av stor total kapacitet och låg beräkningskostnad per token: 125 miljarder parametrar i huvudmodellen, plus 51 miljarder parametrar i en N-gram-komponent, men bara omkring 6 miljarder aktiva parametrar per token. Tanken är att behålla en stor modellkapacitet utan att behöva köra hela modellen för varje ord eller tecken.
Namnet Qwen3.8-Flash-Next syftar på den öppna modell som Qwen har publicerat. Qwen3.8-Flash används däremot för den produktionsinriktade modellen och API-tjänsten. Rapporteringen beskriver den öppna versionen som ett multimodalt system baserat på en så kallad mixture-of-experts-arkitektur, eller MoE, där olika delar av modellen aktiveras beroende på uppgiften. 1
2
15
Skillnaden är viktig. Qwen3.8-Flash-Next ska främst ses som en teknisk prototyp och ett utvecklarunderlag – inte som ett bevis på att hela Qwen4-serien redan har lanserats. Genom att släppa vikterna tidigt får forskare och utvecklare möjlighet att undersöka designen, anpassa verktyg och ge återkoppling innan den bredare Qwen4-familjen kommer. 2
3
15
Uppgiften om 1 miljon token ska inte blandas ihop med modellens inbyggda kontextgräns. Den normala konfigurationen anger 262 144 token. Det större fönstret kräver YaRN-utökning och bör därför betraktas som en utvidgad konfiguration, inte som modellens ursprungliga standardläge. 1
4
16
Qwen3.8-Flash-Next kombinerar Gated DeltaNet, förkortat GDN, med Qwen Sparse Attention, QSA. GDN är utformat för att komprimera information från tidigare delar av kontexten. QSA använder i sin tur ett lättviktigt index för att hitta relevanta mikrosektorer i historiken, i stället för att tillämpa full uppmärksamhet på varje tidigare token. 4
Målet är att göra inferens med långa kontexter mindre dyr och mindre långsam när textsekvenserna växer. Qwen uppger upp till 7,6 gånger snabbare förbehandling och 4,9 gånger snabbare avkodning vid sekvenser på 1 miljon token. Det är dock leverantörens egna siffror, och utfallet beror bland annat på hårdvara, implementation, sekvenslängd och testupplägg. 4
Den separata N-gram-komponenten tillför representativ kapacitet utan att hela parameteruppsättningen måste bearbetas aktivt för varje token. Qwen stöder dessutom att inbäddningstabellen placeras i värdminnet och att data hämtas asynkront. På så sätt kan dataöverföringar överlappa med modellens beräkningar. 4
För den som driver stora modeller är detta en praktiskt viktig riktning. Var data lagras och hur den flyttas kan vara minst lika avgörande som det totala antalet parametrar – särskilt vid långa dokument eller stora batchkörningar.
Förhandsvisningen innehåller också förändringar i optimering och skalning. Qwen uppger att teamet använder Muon-optimeraren, har justerat samspelet mellan Muon och AdamW samt tagit fram en ny anpassad skalningslag för modelltypen. 4
Det gör lanseringen till mer än bara en ny kontrollpunkt med ett annat uppmärksamhetsblock. Den fungerar som ett offentligt test av en bredare metod för att bygga modeller med stor total kapacitet men relativt liten aktiv beräkning.
Qwen uppger att träningen av Qwen3.8-Flash kostade ungefär en niondel så mycket som träningen av Qwen3.7-Plus, samtidigt som modellen förbättrade resultaten inom programmering och kontorsrelaterade uppgifter. Reuters rapporterade oberoende om företagets påståenden om starkare kodnings- och kontorsresultat samt lägre träningskostnader. 1
4
I lanseringsmaterialet nämns resultaten 58,7 i DeepSWE 1.1, 62,5 i SWE-bench Pro och 84,5 i AndroidWorld. Qwen placerar dessa siffror före DeepSeek V4 Flash i värdesegmentet. Jämförelserna kommer från företaget självt; det tillgängliga materialet visar inte att resultaten har upprepats oberoende under helt likvärdiga testförhållanden. 4
Det angivna API-priset för den produktionsinriktade Qwen3.8-Flash-tjänsten är 1 yuan per miljon indatatoken och 3 yuan per miljon utdatatoken. I lanseringsmaterialet beskrivs ingen skillnad mellan hög- och lågbelastningstider. Prisjämförelser med andra modeller beror dock på modellversion, cachelagring, kontextlängd, servicenivå och hur omfattande svar som krävs. 1
4
De öppna vikterna gör Qwen3.8-Flash-Next användbar som experimentplattform inför Qwen4. Utvecklare kan börja anpassa inferensverktyg, testa kvantisering och serverlösningar samt se hur arkitekturen fungerar på de egna arbetslasterna – utan att behöva vänta på en färdig Qwen4-implementation. 2
3
15
Designen är särskilt relevant för uppgifter där kontextlängd eller kostnad per token är en begränsning, till exempel:
Detta är rimliga användningsområden utifrån modellens långkontext- och aktiv-parameterdesign, inte garantier för att den slår varje tät modell eller varje alternativ med full uppmärksamhet i produktion. Den faktiska ekonomin avgörs också av hårdvara, serverprogramvara, kvantiseringskvalitet, retrieval-strategi och arbetslastens sammansättning.
Qwen3.8-Flash-Next är betydelsefull eftersom den visar en arkitektonisk riktning ovanligt tidigt. Utvecklarcommunityt får ett konkret sätt att undersöka om gles och komprimerad uppmärksamhet, stora extra inbäddningstabeller och få aktiva parametrar kan ge bättre ekonomi vid mycket långa kontexter utan oacceptabla kvalitetsförluster.
Samtidigt kommer de starkaste siffrorna i lanseringen – bland annat hastighetsvinster, benchmarkövertag, lägre träningskostnad och konkurrenskraft per krona – i huvudsak från Qwen eller från rapportering som bygger på Qwens egna uppgifter. Oberoende tester behövs fortfarande på olika hårdvaruplattformar, språk, kontextlängder, multimodala uppgifter och agentarbetsflöden.
Den mest hållbara slutsatsen är därför inte att Qwen3.8-Flash-Next slår alla konkurrenter. Snarare är det en öppen, multimodal MoE-förhandsvisning som ger utvecklare en ovanligt tidig inblick i den systemarkitektur Alibaba förbereder för Qwen4 – och en testbar ritning för att göra AI med mycket långa kontexter mer effektiv.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen3.8 Flash Next släpptes den 26 augusti 2026 som en öppen, multimodal förhandsvisning av arkitekturen bakom Qwen4.
Qwen3.8 Flash Next släpptes den 26 augusti 2026 som en öppen, multimodal förhandsvisning av arkitekturen bakom Qwen4. Modellen har 125 miljarder parametrar i huvudnätverket och ytterligare 51 miljarder i N gram inbäddningar, men aktiverar bara cirka 6 miljarder parametrar per token.
Det inbyggda kontextfönstret är 262 144 token och kan utökas till 1 miljon token med YaRN.