Qwen3.8 Flash Next vyšel 26. srpna 2026 jako otevřený model a předzvěst architektury plánované pro Qwen4, nikoli jako hotový vlajkový model Qwen4.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Alibaba a její výzkumný tým Qwen vydaly 26. srpna 2026 model Qwen3.8-Flash-Next; další informace o vydání se objevily 27. srpna. Nejde o finální vlajkový model Qwen4, ale o otevřený a pro vývojáře kontrolovatelný náhled architektury, která má budoucí řadu Qwen4 pohánět. 1
2
15
Nejzajímavější je poměr mezi celkovou velikostí a výpočetní náročností: model má 125 miliard parametrů v hlavní síti a dalších 51 miliard parametrů v N-gram embeddingové komponentě, ale při zpracování jednoho tokenu aktivuje jen přibližně 6 miliard parametrů. Cílem je zachovat vysokou kapacitu modelu, aniž by se při každém tokenu platila výpočetní cena celé sítě. 4
15
Označení Qwen3.8-Flash-Next patří otevřenému modelu. Název Qwen3.8-Flash se používá pro produkčně zaměřenou variantu a nabídku API. „Next“ tedy označuje veřejně dostupný náhled architektury, nikoli důkaz, že už byla uvedena kompletní rodina Qwen4. 1
2
15
Tento rozdíl je důležitý. Qwen3.8-Flash-Next funguje spíše jako technický prototyp a vývojářský plán: výzkumníci mohou zkoumat jeho konstrukci, připravovat nástroje pro nasazení, testovat kvantizaci a poskytovat zpětnou vazbu ještě před příchodem plnohodnotného Qwen4. 2
3
15
Údaj o 1 milionu tokenů není totéž co nativní kontextové okno. Standardní konfigurace uvádí 262 144 tokenů; delší rozsah závisí na rozšíření YaRN a měl by se posuzovat jako rozšířená konfigurace, nikoli jako základní limit modelu. 1
4
16
Qwen3.8-Flash-Next kombinuje Gated DeltaNet (GDN) s Qwen Sparse Attention (QSA). GDN je navržen tak, aby komprimoval informace z dřívější části kontextu. QSA pak pomocí odlehčeného indexu vyhledává relevantní mikrobloky, místo aby rovnoměrně aplikoval plnou pozornost na celou historii. 4
Smyslem je omezit růst nákladů a zpomalování inference s tím, jak se sekvence prodlužuje. Qwen uvádí až 7,6násobné zrychlení předzpracování kontextu (prefill) a 4,9násobné zrychlení generování (decode) u sekvencí dlouhých 1 milion tokenů. Jde však o údaje uváděné výrobcem; skutečný výsledek závisí na hardwaru, implementaci, délce sekvence i nastavení benchmarku. 4
Samostatná N-gram embeddingová komponenta rozšiřuje reprezentanční kapacitu modelu, aniž by bylo nutné při každém tokenu aktivně zpracovávat celý počet parametrů. Qwen zároveň podporuje přesun této rozsáhlé embeddingové tabulky do operační paměti hostitelského systému a její asynchronní přednačítání. Přenos dat tak může probíhat souběžně s výpočty modelu. 4
Pro provozovatele velkých modelů je to praktický směr. O výsledné náročnosti totiž nerozhoduje jen počet parametrů, ale také jejich umístění v paměti a přesuny dat — zvlášť při práci s dlouhými dokumenty nebo při dávkovém zpracování velkého množství požadavků.
Náhled se netýká pouze nové vrstvy pozornosti. Qwen uvádí také použití optimalizátoru Muon, úpravy jeho spolupráce s AdamW a změny v zacházení s parametry. Tým zároveň použil nově přizpůsobený scaling law, tedy empirický model popisující vztah mezi velikostí sítě, množstvím dat, výpočty a dosaženou kvalitou. 4
Qwen3.8-Flash-Next je proto veřejným testem širšího receptu na konstrukci modelů, které kombinují vysokou celkovou kapacitu s relativně nízkým aktivním výpočtem.
Qwen tvrdí, že trénování Qwen3.8-Flash vyžadovalo přibližně devítinu nákladů oproti modelu Qwen3.7-Plus, přestože se zlepšil výkon v programování a kancelářských úlohách. Reuters nezávisle informoval o tvrzení společnosti, že novinka přináší lepší výsledky v těchto oblastech při nižších trénovacích nákladech. 1
4
Ve zprávách o vydání se objevují skóre 58,7 v DeepSWE 1.1, 62,5 ve SWE-bench Pro a 84,5 v AndroidWorld. Qwen tato čísla staví nad výsledky modelu DeepSeek V4 Flash v hodnotově zaměřeném segmentu. Jde však o srovnání uváděná společností; dostupné podklady nepotvrzují, že byla nezávisle zopakována za zcela srovnatelných podmínek. 4
U produkční nabídky Qwen3.8-Flash Qwen uvádí cenu 1 jüan za 1 milion vstupních tokenů a 3 jüany za 1 milion výstupních tokenů. V materiálech k vydání není popsán rozdíl mezi špičkou a mimošpičkovým provozem. Přímé porovnání s jinými modely je přesto potřeba brát s rezervou: cenu ovlivňuje verze modelu, cachování, délka kontextu, úroveň služby i požadovaná délka výstupu. 1
4
Otevřené váhy dávají vývojářům možnost připravit se na směr, kterým se Qwen4 pravděpodobně vydá, ještě před vydáním celé nové rodiny. Mohou adaptovat inference nástroje, zkoušet kvantizované varianty a různé způsoby obsluhy modelu nebo ověřit jeho chování na vlastních datech. 2
3
15
Návrh je obzvlášť relevantní pro úlohy, které narážejí na délku kontextu nebo cenu tokenů, například:
To jsou rozumné oblasti využití vyplývající z návrhu dlouhého kontextu a nízkého počtu aktivních parametrů. Nejde ale o záruku, že model v každém produkčním nasazení překoná husté modely nebo alternativy využívající plnou pozornost. O skutečné ekonomice rozhodnou mimo jiné hardware, obslužný software, kvalita kvantizace, strategie vyhledávání a konkrétní složení úloh.
Qwen3.8-Flash-Next je zajímavý především tím, že zpřístupňuje architektonický směr velmi brzy. Komunita může přímo ověřovat, zda kombinace řídké a komprimované pozornosti, velkých pomocných embeddingů a nízkého počtu aktivních parametrů skutečně přinese levnější práci s dlouhým kontextem bez nepřijatelných ztrát kvality.
Nejvýraznější čísla — zrychlení, výsledky benchmarků, úspora nákladů na trénování i konkurenční cenová tvrzení — však pocházejí převážně od Qwen nebo z reportingu založeného na jeho zveřejněných údajích. Nezávislé testy budou potřeba napříč hardwarem, jazyky, délkami kontextu, multimodálními úlohami i produkčními agentními scénáři.
Nejstřízlivější závěr proto nezní, že Qwen3.8-Flash-Next poráží každý konkurenční model. Jde o otevřený multimodální MoE model a prakticky testovatelný náhled na systémovou architekturu, kterou Alibaba připravuje pro Qwen4 — a zároveň o jeden z konkrétních pokusů, jak udělat umělou inteligenci pracující s velmi dlouhým kontextem efektivnější.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen3.8 Flash Next vyšel 26. srpna 2026 jako otevřený model a předzvěst architektury plánované pro Qwen4, nikoli jako hotový vlajkový model Qwen4.
Qwen3.8 Flash Next vyšel 26. srpna 2026 jako otevřený model a předzvěst architektury plánované pro Qwen4, nikoli jako hotový vlajkový model Qwen4. Má hlavní síť se 125 miliardami parametrů a dalších 51 miliard parametrů v N gram embeddingové komponentě, přičemž na jeden token aktivuje zhruba 6 miliard parametrů.
Nativní kontext má délku 262 144 tokenů; pomocí YaRN jej lze rozšířit až na 1 milion tokenů.