Alibaba koppelt Qwen3.8 Flash, een multimodaal cloudmodel voor $0,16 per miljoen inputtokens en $0,47 per miljoen outputtokens, aan Flash Next, een open weights preview voor Qwen4. Flash Next combineert een hoofdmodel van 125 miljard parameters met 51 miljard parameters aan N gram embeddings, terwijl per token slech...
Gepubliceerd doorBewerkt met GPT-5.6 LunaAfbeeldingen gegenereerd met GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Alibaba heeft twee nauw verwante Qwen-releases aangekondigd, met elk een andere functie. Qwen3.8-Flash is het multimodale productiemodel dat via QwenCloud wordt aangeboden tegen opvallend lage tokenprijzen. Qwen3.8-Flash-Next is een open-weights-preview van de architectuur die volgens Alibaba de basis moet vormen voor de toekomstige Qwen4-familie. 5
15
De strategie daarachter is helder: met goedkope gehoste inferentie wil Alibaba zakelijke workloads aantrekken, terwijl open gewichten ontwikkelaars moeten aanmoedigen om Qwen te testen, aan te passen en in hun eigen tooling op te nemen. De technische claims zijn interessant, maar veel prestatie- en kostenindicaties zijn afkomstig van Alibaba zelf of van het model card, niet van onafhankelijke tests.
Alibaba omschrijft Qwen3.8-Flash als een multimodaal mixture-of-experts-model voor onder meer programmeren, kantoorwerk en taken met een lange context. Het model heeft standaard een contextvenster van 262.144 tokens, dat volgens Alibaba kan worden uitgebreid tot 1 miljoen tokens voor grote bestanden, lange gesprekken en onderzoeksworkflows. 5
15
De aangekondigde prijs via QwenCloud bedraagt $0,16 per miljoen inputtokens en $0,47 per miljoen outputtokens. Alibaba zei dat de productie-API binnenkort beschikbaar zou komen; latere berichtgeving beschreef QwenCloud als de dienst die het model tegen deze tarieven aanbiedt. 4
15
Daarmee positioneert Alibaba Flash niet alleen als model, maar ook als infrastructuurproduct. Bij zulke tarieven kunnen ontwikkelaars experimenteren met documentverwerking, programmeeragents en grootschalige workflows zonder de premie te betalen die doorgaans hoort bij modellen aan de top van de markt.
Flash-Next is geen tweede API-abonnement. Het is een open-weights-model dat architectuurideeën voor Qwen4 moet laten zien. De modelrepository noemt een hoofdmodel van 125 miljard parameters, daarbovenop 51 miljard parameters in N-gram-embeddings, en slechts 6 miljard geactiveerde parameters per token.
Dit is een schaars mixture-of-experts-ontwerp. Het model bevat een grote verzameling parameters, maar gebruikt per token slechts een klein deel daarvan. In theorie kan dat de berekeningen per token beperken, terwijl de totale capaciteit groter blijft dan bij een vergelijkbaar dicht model.
De beschikbare modelinformatie vermeldt een native contextvenster van 262.144 tokens, uitbreidbaar tot 1 miljoen tokens met YaRN. 13 Omdat Flash en Flash-Next afzonderlijke releases zijn, moeten ontwikkelaars de exacte limieten, het serveergedrag en de geheugenvereisten controleren in de documentatie van de versie die zij willen inzetten.
| Kenmerk | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Hoofdrol | Gehost productiemodel | Open preview van de architectuur voor Qwen4 |
| Modaliteit en toepassingen | Multimodaal programmeren, kantoorwerk en agent-workflows | Multimodaal programmeren, kantoorwerk en langdurige agent-taken |
| Context | Standaard 262.144 tokens; uitbreidbaar tot 1 miljoen | Native 262.144 tokens; volgens de berichtgeving uitbreidbaar tot 1 miljoen met YaRN |
| Gehoste prijs | $0,16 per miljoen inputtokens; $0,47 per miljoen outputtokens | Geen Alibaba-API-prijs vastgesteld voor de open gewichten |
| Architectuur | Alibaba presenteert de Flash-lijn als multimodale MoE | 125 miljard hoofdmodelparameters, 51 miljard N-gram-embeddings en 6 miljard actieve parameters per token |
| Beschikbaarheid | Productie-API via QwenCloud aangekondigd voor de nabije toekomst | Gewichten en modelinformatie verschenen eind augustus 2026 |
De timing onderstreept de samenhang tussen beide producten. De repository en modelinformatie van Flash-Next verschenen vóór of rond de aankondiging van de productie-API. Ontwikkelaars kregen zo alvast zicht op de architectuur, terwijl Alibaba de gehoste dienst voorbereidde. 7
Alibaba zegt dat de nieuwe Flash-lijn ongeveer een negende van de trainingskosten van Qwen3.7-Plus nodig heeft en tegelijk beter presteert, vooral bij programmeer- en kantoortaken. 5
15
Dat is een grote claim, maar voorlopig moet die worden gelezen als een vergelijking van het bedrijf zelf, niet als een onafhankelijk gecontroleerde kostenstudie. Trainingskosten hangen onder meer af van hardwareprijzen, trainingsduur, datavoorbereiding, mislukte runs en de gekozen boekhoudmethode. De schaarse architectuur biedt wel een technisch plausibele verklaring voor Alibaba’s nadruk op efficiëntie: per token wordt slechts een fractie van de beschikbare parameters geactiveerd.
Voor afnemers is het onderscheid praktischer. De gehoste Flash-prijs is direct bruikbaar voor een API-begroting; de claim van een negende van de trainingskosten is voorlopig vooral een signaal over de architectuur en de strategische richting.
Het model card van Flash-Next vermeldt de volgende resultaten:
In de vergelijkingstabel van het model card scoort Flash-Next hoger dan het vermelde resultaat van Claude Opus 4.6 Max op SWE-bench Pro, SWE-bench Multilingual, CoWorkBench en JobBench. Op SWE-bench Pro is de vergelijking bijvoorbeeld 62,5 tegenover 53,4; op SWE-bench Multilingual is dat 81,0 tegenover 77,5.
De cijfers wijzen op sterke prestaties bij softwareontwikkeling en agenttaken voor kenniswerk. Ze bewijzen niet dat Flash-Next op elk terrein beter is dan Claude of andere geavanceerde modellen. De resultaten zijn door de leverancier gepubliceerd, testopstellingen kunnen verschillen en de cijfers van Flash-Next mogen niet automatisch worden gelijkgesteld aan de prestaties van iedere productie-inzet van Qwen3.8-Flash.
De bronnen beschrijven Flash-Next als open-weight. Een gepubliceerde modelsamenvatting noemt de licentie qwen-community-1.0, maar ontwikkelaars doen er goed aan de geldende licentie in de officiële repository en het model card te controleren voordat zij het model commercieel verspreiden, finetunen of als eigen dienst aanbieden. 6
‘Open-weight’ betekent niet automatisch dat elk gebruik onbeperkt is toegestaan. Een licentie kan voorwaarden bevatten voor herdistributie, naamsvermelding, toegestaan gebruik of afgeleide modellen. De beschikbare informatie is onvoldoende om voor elk onderdeel van de release algemene uitspraken te doen over commerciële gebruiksrechten.
De lancering komt op een moment dat Alibaba zwaar investeert in zijn AI-infrastructuur. Reuters meldde dat de kwartaalomzet van de clouddivisie met 45 procent steeg, terwijl de kapitaaluitgaven met 75 procent toenamen en de kwartaalwinst met 75 procent daalde. 18
Reuters meldde daarnaast dat Alibaba via een aandelenplaatsing in Hongkong $10 miljard wilde ophalen om zijn AI-ambities te financieren. Samen laten deze cijfers de ruil zien die achter de Qwen-strategie schuilgaat: de vraag naar cloud- en AI-rekenkracht groeit, maar de kosten voor het bouwen van die capaciteit drukken voorlopig zwaar op winst en kasstromen.
Lage prijzen kunnen daarom strategisch nuttig zijn, zelfs als ze de winstmarge op korte termijn beperken. Goedkope inferentie kan het gebruik van Alibaba’s cloudinfrastructuur verhogen, zakelijke workloads aantrekken en Qwen aantrekkelijk maken voor ontwikkelaars die toepassingen bouwen met lange contextvensters.
Met Flash-Next reikt Alibaba verder dan zijn eigen API. Ontwikkelaars kunnen het model testen, aanpassen en zelf hosten. Zo bouwen zij ervaring op met Qwen-tools en de onderliggende architectuur zonder zich direct aan QwenCloud te verbinden.
Dat kan Alibaba op meerdere manieren helpen:
De beschikbare bronnen ondersteunen deze lezing als strategische interpretatie. Ze bewijzen niet dat Qwen het Chinese ontwikkelaarsecosysteem al heeft veroverd. Er is geen gecontroleerd actueel cijfer aangeleverd voor actieve ontwikkelaars, downloads of zakelijke implementaties.
Qwen3.8-Flash en Flash-Next zijn het best te begrijpen als twee onderdelen van één productstrategie. Flash is de goedkope cloudservice met lange context; Flash-Next is de open-weights- en architectuurzet richting Qwen4.
De combinatie van $0,16 per miljoen inputtokens, tot 1 miljoen tokens context, een gerapporteerde route met 6 miljard actieve parameters door een veel groter model en sterke, door de leverancier gepubliceerde resultaten bij programmeer- en agentbenchmarks maakt de release relevant voor ontwikkelaars die de kosten van AI-inferentie volgen. 4
De kanttekeningen blijven echter belangrijk. Het productie- en previewmodel mogen niet door elkaar worden gehaald, de claim over trainingskosten is niet onafhankelijk gecontroleerd, de benchmarkvergelijkingen zijn door de leverancier aangeleverd en de omvang van de adoptie kan op basis van de beschikbare gegevens niet worden vastgesteld. Alibaba lijkt een serieuze, goed gefinancierde concurrent in de Chinese AI-race — maar niet een onaantastbare leider. De bereidheid om zwaar te investeren laat zien dat Qwen wordt behandeld als een langetermijnweddenschap op cloud en ecosysteem, niet als een snelle winstmachine. 18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Alibaba koppelt Qwen3.8 Flash, een multimodaal cloudmodel voor $0,16 per miljoen inputtokens en $0,47 per miljoen outputtokens, aan Flash Next, een open weights preview voor Qwen4.
Alibaba koppelt Qwen3.8 Flash, een multimodaal cloudmodel voor $0,16 per miljoen inputtokens en $0,47 per miljoen outputtokens, aan Flash Next, een open weights preview voor Qwen4. Flash Next combineert een hoofdmodel van 125 miljard parameters met 51 miljard parameters aan N gram embeddings, terwijl per token slechts 6 miljard parameters worden geactiveerd.
De lancering past in Alibaba’s bredere AI strategie: de cloudomzet groeit, maar een stijging van de kapitaaluitgaven met 75 procent ging samen met een daling van de kwartaalwinst met 75 procent.
Alibaba koppelt Qwen3.8 Flash, een multimodaal cloudmodel voor $0,16 per miljoen inputtokens en $0,47 per miljoen outputtokens, aan Flash Next, een open weights preview voor Qwen4. Flash Next combineert een hoofdmodel van 125 miljard parameters met 51 miljard parameters aan N gram embeddings, terwijl per token slech...
Gepubliceerd doorBewerkt met GPT-5.6 LunaAfbeeldingen gegenereerd met GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Alibaba heeft twee nauw verwante Qwen-releases aangekondigd, met elk een andere functie. Qwen3.8-Flash is het multimodale productiemodel dat via QwenCloud wordt aangeboden tegen opvallend lage tokenprijzen. Qwen3.8-Flash-Next is een open-weights-preview van de architectuur die volgens Alibaba de basis moet vormen voor de toekomstige Qwen4-familie. 5
15
De strategie daarachter is helder: met goedkope gehoste inferentie wil Alibaba zakelijke workloads aantrekken, terwijl open gewichten ontwikkelaars moeten aanmoedigen om Qwen te testen, aan te passen en in hun eigen tooling op te nemen. De technische claims zijn interessant, maar veel prestatie- en kostenindicaties zijn afkomstig van Alibaba zelf of van het model card, niet van onafhankelijke tests.
Alibaba omschrijft Qwen3.8-Flash als een multimodaal mixture-of-experts-model voor onder meer programmeren, kantoorwerk en taken met een lange context. Het model heeft standaard een contextvenster van 262.144 tokens, dat volgens Alibaba kan worden uitgebreid tot 1 miljoen tokens voor grote bestanden, lange gesprekken en onderzoeksworkflows. 5
15
De aangekondigde prijs via QwenCloud bedraagt $0,16 per miljoen inputtokens en $0,47 per miljoen outputtokens. Alibaba zei dat de productie-API binnenkort beschikbaar zou komen; latere berichtgeving beschreef QwenCloud als de dienst die het model tegen deze tarieven aanbiedt. 4
15
Daarmee positioneert Alibaba Flash niet alleen als model, maar ook als infrastructuurproduct. Bij zulke tarieven kunnen ontwikkelaars experimenteren met documentverwerking, programmeeragents en grootschalige workflows zonder de premie te betalen die doorgaans hoort bij modellen aan de top van de markt.
Flash-Next is geen tweede API-abonnement. Het is een open-weights-model dat architectuurideeën voor Qwen4 moet laten zien. De modelrepository noemt een hoofdmodel van 125 miljard parameters, daarbovenop 51 miljard parameters in N-gram-embeddings, en slechts 6 miljard geactiveerde parameters per token.
Dit is een schaars mixture-of-experts-ontwerp. Het model bevat een grote verzameling parameters, maar gebruikt per token slechts een klein deel daarvan. In theorie kan dat de berekeningen per token beperken, terwijl de totale capaciteit groter blijft dan bij een vergelijkbaar dicht model.
De beschikbare modelinformatie vermeldt een native contextvenster van 262.144 tokens, uitbreidbaar tot 1 miljoen tokens met YaRN. 13 Omdat Flash en Flash-Next afzonderlijke releases zijn, moeten ontwikkelaars de exacte limieten, het serveergedrag en de geheugenvereisten controleren in de documentatie van de versie die zij willen inzetten.
| Kenmerk | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Hoofdrol | Gehost productiemodel | Open preview van de architectuur voor Qwen4 |
| Modaliteit en toepassingen | Multimodaal programmeren, kantoorwerk en agent-workflows | Multimodaal programmeren, kantoorwerk en langdurige agent-taken |
| Context | Standaard 262.144 tokens; uitbreidbaar tot 1 miljoen | Native 262.144 tokens; volgens de berichtgeving uitbreidbaar tot 1 miljoen met YaRN |
| Gehoste prijs | $0,16 per miljoen inputtokens; $0,47 per miljoen outputtokens | Geen Alibaba-API-prijs vastgesteld voor de open gewichten |
| Architectuur | Alibaba presenteert de Flash-lijn als multimodale MoE | 125 miljard hoofdmodelparameters, 51 miljard N-gram-embeddings en 6 miljard actieve parameters per token |
| Beschikbaarheid | Productie-API via QwenCloud aangekondigd voor de nabije toekomst | Gewichten en modelinformatie verschenen eind augustus 2026 |
De timing onderstreept de samenhang tussen beide producten. De repository en modelinformatie van Flash-Next verschenen vóór of rond de aankondiging van de productie-API. Ontwikkelaars kregen zo alvast zicht op de architectuur, terwijl Alibaba de gehoste dienst voorbereidde. 7
Alibaba zegt dat de nieuwe Flash-lijn ongeveer een negende van de trainingskosten van Qwen3.7-Plus nodig heeft en tegelijk beter presteert, vooral bij programmeer- en kantoortaken. 5
15
Dat is een grote claim, maar voorlopig moet die worden gelezen als een vergelijking van het bedrijf zelf, niet als een onafhankelijk gecontroleerde kostenstudie. Trainingskosten hangen onder meer af van hardwareprijzen, trainingsduur, datavoorbereiding, mislukte runs en de gekozen boekhoudmethode. De schaarse architectuur biedt wel een technisch plausibele verklaring voor Alibaba’s nadruk op efficiëntie: per token wordt slechts een fractie van de beschikbare parameters geactiveerd.
Voor afnemers is het onderscheid praktischer. De gehoste Flash-prijs is direct bruikbaar voor een API-begroting; de claim van een negende van de trainingskosten is voorlopig vooral een signaal over de architectuur en de strategische richting.
Het model card van Flash-Next vermeldt de volgende resultaten:
In de vergelijkingstabel van het model card scoort Flash-Next hoger dan het vermelde resultaat van Claude Opus 4.6 Max op SWE-bench Pro, SWE-bench Multilingual, CoWorkBench en JobBench. Op SWE-bench Pro is de vergelijking bijvoorbeeld 62,5 tegenover 53,4; op SWE-bench Multilingual is dat 81,0 tegenover 77,5.
De cijfers wijzen op sterke prestaties bij softwareontwikkeling en agenttaken voor kenniswerk. Ze bewijzen niet dat Flash-Next op elk terrein beter is dan Claude of andere geavanceerde modellen. De resultaten zijn door de leverancier gepubliceerd, testopstellingen kunnen verschillen en de cijfers van Flash-Next mogen niet automatisch worden gelijkgesteld aan de prestaties van iedere productie-inzet van Qwen3.8-Flash.
De bronnen beschrijven Flash-Next als open-weight. Een gepubliceerde modelsamenvatting noemt de licentie qwen-community-1.0, maar ontwikkelaars doen er goed aan de geldende licentie in de officiële repository en het model card te controleren voordat zij het model commercieel verspreiden, finetunen of als eigen dienst aanbieden. 6
‘Open-weight’ betekent niet automatisch dat elk gebruik onbeperkt is toegestaan. Een licentie kan voorwaarden bevatten voor herdistributie, naamsvermelding, toegestaan gebruik of afgeleide modellen. De beschikbare informatie is onvoldoende om voor elk onderdeel van de release algemene uitspraken te doen over commerciële gebruiksrechten.
De lancering komt op een moment dat Alibaba zwaar investeert in zijn AI-infrastructuur. Reuters meldde dat de kwartaalomzet van de clouddivisie met 45 procent steeg, terwijl de kapitaaluitgaven met 75 procent toenamen en de kwartaalwinst met 75 procent daalde. 18
Reuters meldde daarnaast dat Alibaba via een aandelenplaatsing in Hongkong $10 miljard wilde ophalen om zijn AI-ambities te financieren. Samen laten deze cijfers de ruil zien die achter de Qwen-strategie schuilgaat: de vraag naar cloud- en AI-rekenkracht groeit, maar de kosten voor het bouwen van die capaciteit drukken voorlopig zwaar op winst en kasstromen.
Lage prijzen kunnen daarom strategisch nuttig zijn, zelfs als ze de winstmarge op korte termijn beperken. Goedkope inferentie kan het gebruik van Alibaba’s cloudinfrastructuur verhogen, zakelijke workloads aantrekken en Qwen aantrekkelijk maken voor ontwikkelaars die toepassingen bouwen met lange contextvensters.
Met Flash-Next reikt Alibaba verder dan zijn eigen API. Ontwikkelaars kunnen het model testen, aanpassen en zelf hosten. Zo bouwen zij ervaring op met Qwen-tools en de onderliggende architectuur zonder zich direct aan QwenCloud te verbinden.
Dat kan Alibaba op meerdere manieren helpen:
De beschikbare bronnen ondersteunen deze lezing als strategische interpretatie. Ze bewijzen niet dat Qwen het Chinese ontwikkelaarsecosysteem al heeft veroverd. Er is geen gecontroleerd actueel cijfer aangeleverd voor actieve ontwikkelaars, downloads of zakelijke implementaties.
Qwen3.8-Flash en Flash-Next zijn het best te begrijpen als twee onderdelen van één productstrategie. Flash is de goedkope cloudservice met lange context; Flash-Next is de open-weights- en architectuurzet richting Qwen4.
De combinatie van $0,16 per miljoen inputtokens, tot 1 miljoen tokens context, een gerapporteerde route met 6 miljard actieve parameters door een veel groter model en sterke, door de leverancier gepubliceerde resultaten bij programmeer- en agentbenchmarks maakt de release relevant voor ontwikkelaars die de kosten van AI-inferentie volgen. 4
De kanttekeningen blijven echter belangrijk. Het productie- en previewmodel mogen niet door elkaar worden gehaald, de claim over trainingskosten is niet onafhankelijk gecontroleerd, de benchmarkvergelijkingen zijn door de leverancier aangeleverd en de omvang van de adoptie kan op basis van de beschikbare gegevens niet worden vastgesteld. Alibaba lijkt een serieuze, goed gefinancierde concurrent in de Chinese AI-race — maar niet een onaantastbare leider. De bereidheid om zwaar te investeren laat zien dat Qwen wordt behandeld als een langetermijnweddenschap op cloud en ecosysteem, niet als een snelle winstmachine. 18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Alibaba koppelt Qwen3.8 Flash, een multimodaal cloudmodel voor $0,16 per miljoen inputtokens en $0,47 per miljoen outputtokens, aan Flash Next, een open weights preview voor Qwen4.
Alibaba koppelt Qwen3.8 Flash, een multimodaal cloudmodel voor $0,16 per miljoen inputtokens en $0,47 per miljoen outputtokens, aan Flash Next, een open weights preview voor Qwen4. Flash Next combineert een hoofdmodel van 125 miljard parameters met 51 miljard parameters aan N gram embeddings, terwijl per token slechts 6 miljard parameters worden geactiveerd.
De lancering past in Alibaba’s bredere AI strategie: de cloudomzet groeit, maar een stijging van de kapitaaluitgaven met 75 procent ging samen met een daling van de kwartaalwinst met 75 procent.