Alibaba łączy Qwen3.8 Flash — hostowany model multimodalny wyceniony na 0,16 dolara za milion tokenów wejściowych i 0,47 dolara za milion tokenów wyjściowych — z Flash Next, otwartą wagowo zapowiedzią architektury Qwen4. Flash Next ma główny model o 125 mld parametrów oraz dodatkowe 51 mld parametrów osadzeń N gram,...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Alibaba zaprezentowała dwa powiązane, ale pełniące różne funkcje modele. Qwen3.8-Flash to multimodalny model przeznaczony do zastosowań produkcyjnych i udostępniany przez QwenCloud. Qwen3.8-Flash-Next jest natomiast otwartą wagowo wersją demonstracyjną architektury, którą firma wiąże z przyszłą rodziną Qwen4. 515
Strategia jest czytelna: bardzo tania inferencja ma przyciągać firmy korzystające z chmury, a otwarte wagi — programistów, narzędzia i społeczność budującą rozwiązania wokół Qwen4. Warto jednak pamiętać, że wiele danych dotyczących wydajności i kosztów pochodzi bezpośrednio od Alibaba albo z karty modelu, a nie z niezależnych testów.
Alibaba opisuje Qwen3.8-Flash jako multimodalny model typu mixture of experts (MoE), zaprojektowany między innymi do programowania, pracy biurowej i zadań wymagających długiego kontekstu. Firma podaje domyślne okno kontekstowe o długości 262 144 tokenów, które można rozszerzyć do 1 miliona tokenów przy pracy z dużymi plikami, długimi rozmowami i materiałami badawczymi. 515
Ogłoszona cena w QwenCloud wynosi 0,16 dolara za milion tokenów wejściowych oraz 0,47 dolara za milion tokenów wyjściowych. Alibaba zapowiedziała, że produkcyjne API będzie wkrótce dostępne, a późniejsze informacje opisywały QwenCloud jako usługę oferującą model w tych stawkach. 415
To pozycjonuje Flasha nie tylko jako model, lecz także jako produkt infrastrukturalny. Przy takiej cenie deweloperzy mogą testować przetwarzanie dokumentów, agentów programistycznych i masowe przepływy pracy bez kosztów typowych dla najdroższych modeli czołowych.
Flash-Next nie jest po prostu drugim planem taryfowym API. To model z udostępnionymi wagami, który ma pokazywać rozwiązania architektoniczne planowane dla Qwen4. Repozytorium modelu wskazuje na 125 mld parametrów głównego modelu, dodatkowe 51 mld parametrów osadzeń N-gram oraz zaledwie 6 mld parametrów aktywowanych dla pojedynczego tokena.
Taki model wykorzystuje rzadką architekturę mixture of experts. Zawiera dużą pulę parametrów, lecz przy przetwarzaniu każdego tokena uruchamia tylko jej część. W założeniu pozwala to ograniczyć obliczenia przy zachowaniu większego potencjału niż w porównywalnym, gęstym modelu.
Dane z karty modelu wskazują na natywne okno kontekstowe długości 262 144 tokenów, rozszerzalne do 1 miliona tokenów z użyciem techniki YaRN. 13 Ponieważ Flash i Flash-Next są odrębnymi wydaniami, przed wdrożeniem warto sprawdzić dokładne limity, sposób obsługi oraz wymagania pamięciowe w dokumentacji konkretnej wersji.
| Cecha | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Główne zastosowanie | Hostowany model produkcyjny | Otwarta wagowo wersja demonstracyjna architektury Qwen4 |
| Modalność i zastosowania | Multimodalne programowanie, praca biurowa i zadania agentowe | Multimodalne programowanie, praca biurowa i długie zadania agentowe |
| Kontekst | Domyślnie 262 144 tokenów; możliwość rozszerzenia do 1 miliona | Natywnie 262 144 tokenów; według dostępnych danych do 1 miliona z YaRN |
| Cena hostingu | 0,16 dolara za milion tokenów wejściowych; 0,47 dolara za milion tokenów wyjściowych | Brak ustalonej ceny API Alibaba dla otwartych wag |
| Architektura | Alibaba opisuje linię Flash jako multimodalne MoE | 125 mld parametrów modelu głównego, 51 mld parametrów osadzeń N-gram, 6 mld aktywnych na token |
| Dostępność | Produkcyjne API QwenCloud zapowiedziane na koniec sierpnia 2026 roku | Wagi i informacje z karty modelu pojawiły się pod koniec sierpnia 2026 roku |
Kolejność premier podkreśla związek między produktami. Repozytorium i materiały dotyczące karty Flash-Next stały się dostępne przed lub mniej więcej w tym samym czasie co zapowiedź produkcyjnego API. Deweloperzy otrzymali więc wczesny wgląd w architekturę, gdy Alibaba przygotowywała usługę hostowaną. 7
Alibaba twierdzi, że nowa linia Flash wymaga około dziewięciokrotnie niższych kosztów treningu niż Qwen3.7-Plus, a jednocześnie zapewnia lepsze wyniki, szczególnie w programowaniu i zadaniach biurowych. 515
To znacząca deklaracja, ale należy traktować ją jako porównanie przedstawione przez producenta, a nie niezależnie zbadane rozliczenie kosztów. Na koszt treningu wpływają między innymi ceny sprzętu, czas obliczeń, przygotowanie danych, nieudane przebiegi oraz przyjęta metoda księgowania. Rzadka architektura stanowi jednak wiarygodne techniczne uzasadnienie nacisku Alibaba na efektywność: przy każdym tokenie aktywowana jest tylko część dostępnych parametrów.
Dla klientów praktyczna różnica jest prostsza. Cena hostowanego Flasha może od razu posłużyć do planowania budżetu API. Wskaźnik „jedna dziewiąta kosztu” lepiej traktować jako sygnał architektoniczny i strategiczny do czasu pojawienia się porównywalnych, niezależnych pomiarów.
Karta modelu Flash-Next podaje następujące wyniki:
W tabeli porównawczej zamieszczonej w karcie modelu Flash-Next uzyskał wyższe wyniki niż wymieniony wariant Claude Opus 4.6 Max w testach SWE-bench Pro, SWE-bench Multilingual, CoWorkBench i JobBench. Przykładowo podany wynik SWE-bench Pro to 62,5 wobec 53,4, a SWE-bench Multilingual — 81,0 wobec 77,5.
Rezultaty sugerują mocną pozycję w zadaniach związanych z inżynierią oprogramowania i agentami wykonującymi pracę biurową. Nie dowodzą jednak, że Flash-Next jest uniwersalnie lepszy od Claude’a ani od innych zaawansowanych systemów. Wyniki pochodzą od dostawcy, konfiguracje testów mogą się różnić, a rezultatów Flash-Next nie należy automatycznie przypisywać każdemu wdrożeniu produkcyjnego Qwen3.8-Flash.
Źródła opisują Flash-Next jako model z otwartymi wagami. Jedno z opublikowanych podsumowań wskazuje licencję qwen-community-1.0, ale przed komercyjną redystrybucją, dostrajaniem lub uruchomieniem usługi warto zweryfikować aktualne warunki w oficjalnym repozytorium i karcie modelu. 6
„Otwarte wagi” nie oznaczają automatycznie pełnej swobody wykorzystania. Licencja może określać zasady redystrybucji, atrybucji, dopuszczalnego użycia lub tworzenia modeli pochodnych. Dostępne dane nie wystarczają, by sformułować szersze twierdzenie o uprawnieniach komercyjnych dotyczących każdego elementu wydania.
Premiera następuje w momencie, gdy Alibaba intensywnie rozbudowuje infrastrukturę AI. Według Reutersa kwartalne przychody z chmury wzrosły o 45 proc., nakłady inwestycyjne zwiększyły się o 75 proc., a kwartalny zysk netto spadł o 75 proc. 18
Reuters informował również, że Alibaba pozyskiwała 10 mld dolarów poprzez emisję akcji w Hongkongu, aby sfinansować ambicje związane ze sztuczną inteligencją. Liczby te pokazują koszt obranej strategii: popyt na usługi chmurowe i moc obliczeniową AI rośnie, lecz budowa odpowiedniej infrastruktury już teraz obciąża wyniki i przepływy pieniężne.
Dlatego niska cena może być dla Alibaba użyteczna strategicznie, nawet jeśli ogranicza marżę na samym modelu. Tania inferencja może zwiększać wykorzystanie infrastruktury chmurowej, przyciągać klientów biznesowych i sprawiać, że Qwen stanie się naturalnym wyborem dla zespołów budujących aplikacje z długim kontekstem.
Wydanie Flash-Next rozszerza zasięg Alibaba poza własne API. Deweloperzy mogą testować, dostosowywać i uruchamiać model samodzielnie, poznając narzędzia i architekturę Qwen bez natychmiastowego zobowiązania do korzystania z QwenCloud.
Taki model dystrybucji może wspierać firmę na kilka sposobów:
Dostępne dowody wspierają taką interpretację strategiczną, ale nie dowodzą, że Qwen zdobył już chiński ekosystem deweloperski. Źródła nie podają zweryfikowanej, aktualnej liczby aktywnych programistów, pobrań ani wdrożeń firmowych.
Qwen3.8-Flash i Flash-Next najlepiej rozumieć jako dwie części jednej strategii produktowej. Flash jest tanią, chmurową usługą z długim kontekstem. Flash-Next ma budować ekosystem i pokazywać architekturę, na której ma bazować Qwen4.
Połączenie ceny 0,16 dolara za milion tokenów wejściowych, kontekstu sięgającego 1 miliona tokenów, ścieżki z zaledwie 6 mld aktywnych parametrów w znacznie większym modelu oraz mocnych, choć opublikowanych przez dostawcę, wyników w zadaniach programistycznych i agentowych sprawia, że premiera jest istotna dla deweloperów obserwujących ekonomię inferencji. 4
Zastrzeżenia pozostają jednak ważne. Model produkcyjny i wersja demonstracyjna nie powinny być utożsamiane, deklaracja o dziewięciokrotnie niższym koszcie treningu nie została niezależnie zweryfikowana, benchmarki pochodzą od producenta, a skali adopcji nie można jeszcze określić na podstawie przedstawionych danych. Alibaba wygląda na poważnego i dobrze finansowanego uczestnika chińskiego wyścigu AI — nie na bezdyskusyjnego lidera. Jej gotowość do dużych wydatków pokazuje, że Qwen jest traktowany jako długoterminowy zakład na chmurę i ekosystem, a nie krótkoterminowe źródło zysku. 18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Alibaba łączy Qwen3.8 Flash — hostowany model multimodalny wyceniony na 0,16 dolara za milion tokenów wejściowych i 0,47 dolara za milion tokenów wyjściowych — z Flash Next, otwartą wagowo zapowiedzią architektury Qwen4.
Alibaba łączy Qwen3.8 Flash — hostowany model multimodalny wyceniony na 0,16 dolara za milion tokenów wejściowych i 0,47 dolara za milion tokenów wyjściowych — z Flash Next, otwartą wagowo zapowiedzią architektury Qwen4. Flash Next ma główny model o 125 mld parametrów oraz dodatkowe 51 mld parametrów osadzeń N gram, ale aktywuje tylko 6 mld parametrów przy każdym tokenie.
Premiera wpisuje się w szerszą strategię Alibaba: przy 45 procentowym wzroście przychodów z chmury nakłady inwestycyjne wzrosły o 75 proc., a kwartalny zysk netto spadł o 75 proc.