Wydany 26 sierpnia 2026 r. Qwen3.8 Flash Next jest otwartym, multimodalnym modelem technicznym zapowiadającym architekturę planowaną dla rodziny Qwen4.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Alibaba i zespół Qwen udostępniły Qwen3.8-Flash-Next 26 sierpnia 2026 r.; kolejne omówienia pojawiły się dzień później. To otwarty model wagowy, który nie jest przedstawiany jako finalny flagowiec Qwen4. Ma być raczej wczesnym, możliwym do zbadania podglądem architektury, na której ma opierać się rodzina Qwen4. 1
2
15
Najciekawsza cecha modelu tkwi w proporcji między jego całkowitą wielkością a kosztem obliczeń. Główna sieć ma 125 mld parametrów, a dodatkowy moduł embeddingów N-gram obejmuje kolejne 51 mld parametrów. Jednocześnie na potrzeby pojedynczego tokenu aktywowanych jest około 6 mld parametrów. To podejście ma zachować dużą pojemność modelu bez konieczności przetwarzania całej sieci przy każdym kolejnym tokenie. 4
15
Warto rozdzielić dwie nazwy. Qwen3.8-Flash-Next to otwarty model udostępniony społeczności. Z kolei Qwen3.8-Flash oznacza wersję produkcyjną i ofertę API. Doniesienia opisują Qwen3.8-Flash-Next jako multimodalny system typu mixture of experts, czyli MoE, zbudowany wokół technologii przygotowywanej dla Qwen4. 1
2
15
To ważne zastrzeżenie: premiera nie oznacza, że cała rodzina Qwen4 została już wydana. Otwarty model pełni funkcję technicznego podglądu i swoistego planu dla deweloperów. Mogą oni wcześniej testować architekturę, przygotować narzędzia do inferencji i zgłaszać uwagi, zanim pojawi się pełna seria Qwen4. 2
3
15
Liczby 262 144 i 1 mln tokenów nie oznaczają tego samego. Pierwsza wartość to natywne okno kontekstu w standardowej konfiguracji. Milion tokenów wymaga zastosowania rozszerzenia YaRN, dlatego należy traktować go jako konfigurację rozszerzoną, a nie podstawowy limit modelu. 1
4
16
Qwen3.8-Flash-Next łączy Gated DeltaNet, w skrócie GDN, z Qwen Sparse Attention, czyli QSA. GDN ma kompresować informacje z wcześniejszej części kontekstu. QSA korzysta natomiast z lekkiego indeksu, który pomaga wyszukać i wybrać istotne mik ব্লoki zamiast stosować pełny mechanizm uwagi równomiernie do całej historii. 4
Celem jest ograniczenie wzrostu kosztu i opóźnień podczas pracy z długimi sekwencjami. Qwen deklaruje do 7,6 raza szybsze przygotowanie kontekstu oraz do 4,9 raza szybsze generowanie przy sekwencjach o długości 1 mln tokenów. Są to jednak wyniki podawane przez producenta, zależne między innymi od sprzętu, implementacji, długości sekwencji i konfiguracji testu. Nie należy traktować ich jako uniwersalnych rezultatów dla każdego wdrożenia. 4
Oddzielny moduł embeddingów N-gram zapewnia dodatkową zdolność reprezentowania informacji, a jednocześnie ogranicza ilość pełnych obliczeń wykonywanych dla każdego tokenu. Qwen przewidział także możliwość przeniesienia tej dużej tablicy embeddingów do pamięci hosta i asynchronicznego pobierania danych. Transfer może być wtedy nakładany na obliczenia modelu. 4
Dla operatorów uruchamiających duże modele to istotny kierunek rozwoju. W praktyce o kosztach może decydować nie tylko liczba parametrów, lecz także rozmieszczenie danych w pamięci i ich przesyłanie — szczególnie przy analizie długich dokumentów oraz przetwarzaniu dużych partii danych.
Podgląd Qwen4 nie ogranicza się do nowego mechanizmu uwagi. Qwen informuje również o wykorzystaniu optymalizatora Muon, modyfikacjach jego współpracy z AdamW i obsługi parametrów, a także o nowo dopasowanym prawie skalowania dla tej architektury. 4
W efekcie Qwen3.8-Flash-Next jest publicznym testem szerszej recepty na budowę modeli, które łączą dużą całkowitą pojemność z relatywnie niewielką liczbą parametrów aktywowanych przy każdym tokenie.
Qwen twierdzi, że trening Qwen3.8-Flash wymagał około dziewięć razy mniejszych nakładów niż trening Qwen3.7-Plus, przy jednoczesnej poprawie wyników w programowaniu i zadaniach biurowych. Reuters niezależnie opisał deklaracje firmy dotyczące wyższej skuteczności w tych obszarach i niższych kosztów treningu. 1
4
W materiałach dotyczących premiery wymieniono wyniki 58,7 pkt w DeepSWE 1.1, 62,5 pkt w SWE-bench Pro oraz 84,5 pkt w AndroidWorld. Qwen pozycjonuje je powyżej DeepSeek V4 Flash w segmencie modeli nastawionych na korzystny stosunek możliwości do ceny. Są to jednak porównania raportowane przez firmę; dostępne materiały nie dowodzą, że zostały niezależnie odtworzone w identycznych warunkach oceny. 4
Dla produkcyjnej wersji Qwen3.8-Flash podawana cena API wynosi 1 juan za milion tokenów wejściowych i 3 juany za milion tokenów wyjściowych. W materiałach dotyczących premiery nie opisano rozróżnienia na stawki szczytowe i pozaszczytowe. Bezpośrednie porównania z innymi modelami nadal zależą od wersji, buforowania, długości kontekstu, poziomu usługi i wymaganej długości odpowiedzi. 1
4
Otwarte wagi sprawiają, że Qwen3.8-Flash-Next może stać się platformą do eksperymentów jeszcze przed premierą Qwen4. Deweloperzy mogą wcześniej dostosować narzędzia do inferencji, przetestować kwantyzację i metody serwowania modelu, a także sprawdzić jego zachowanie na własnych danych. 2
3
15
Architektura jest szczególnie interesująca w zastosowaniach, w których ograniczeniem pozostaje długość kontekstu albo koszt tokenów, na przykład:
To potencjalne zastosowania wynikające z projektu modelu, a nie gwarancja, że Qwen3.8-Flash-Next będzie lepszy od każdej gęstej sieci lub alternatywy wykorzystującej pełną uwagę. O rzeczywistej ekonomice wdrożenia zdecydują między innymi sprzęt, oprogramowanie serwujące, jakość kwantyzacji, strategia wyszukiwania informacji oraz charakter obciążenia.
Znaczenie Qwen3.8-Flash-Next polega przede wszystkim na tym, że Alibaba pokazuje kierunek architektoniczny wcześniej niż zwykle. Społeczność otrzymuje konkretny model do sprawdzenia, pozwalający ocenić, czy rzadka i skompresowana uwaga, duże dodatkowe embeddingi oraz niewielka liczba aktywnych parametrów mogą obniżyć koszt obsługi bardzo długiego kontekstu bez zbyt dużego spadku jakości.
Najmocniejsze deklaracje — dotyczące przyspieszenia, przewagi w benchmarkach, niższych kosztów treningu i korzystnej ceny — pochodzą jednak w dużej mierze od Qwen lub z materiałów opartych na ujawnionych przez Qwen danych. Potrzebne są niezależne testy obejmujące różny sprzęt, języki, długości kontekstu, zadania multimodalne i produkcyjne przepływy pracy agentów.
Najostrożniejszy wniosek brzmi więc nie „Qwen3.8-Flash-Next pokonuje każdy konkurencyjny model”, lecz: to otwarty, multimodalny model MoE, który daje deweloperom wyjątkowo wczesny wgląd w architekturę przygotowywaną dla Qwen4. Jest też sprawdzalnym planem tego, jak można próbować uczynić sztuczną inteligencję działającą na bardzo długim kontekście tańszą i szybszą.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Wydany 26 sierpnia 2026 r. Qwen3.8 Flash Next jest otwartym, multimodalnym modelem technicznym zapowiadającym architekturę planowaną dla rodziny Qwen4.
Wydany 26 sierpnia 2026 r. Qwen3.8 Flash Next jest otwartym, multimodalnym modelem technicznym zapowiadającym architekturę planowaną dla rodziny Qwen4. Model łączy Gated DeltaNet z Qwen Sparse Attention oraz wykorzystuje dodatkowy moduł embeddingów N gram o wielkości 51 mld parametrów, aby ograniczyć koszt obsługi bardzo długiego kontekstu.
Natywne okno kontekstu obejmuje 262 144 tokeny, a z rozszerzeniem YaRN może sięgać 1 mln tokenów.