Alibaba affianca Qwen3.8 Flash, modello multimodale destinato alla produzione e proposto a 0,16 dollari per milione di token in input e 0,47 dollari in output, a Flash Next, anteprima open weight dell’architettura Qwen4. Flash Next combina un modello principale da 125 miliardi di parametri con 51 miliardi di paramet...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Alibaba sta presentando due modelli collegati, ma con funzioni diverse. Qwen3.8-Flash è il modello multimodale pensato per l’uso in produzione e distribuito tramite QwenCloud a prezzi insolitamente bassi. Qwen3.8-Flash-Next è invece una versione open-weight, cioè con i pesi disponibili per il download e il self-hosting, concepita come anteprima dell’architettura destinata alla futura famiglia Qwen4. 515
La logica industriale è chiara: usare l’inferenza ospitata a basso costo per attirare carichi di lavoro aziendali e, allo stesso tempo, distribuire i pesi aperti per favorire adozione tra sviluppatori, strumenti compatibili e familiarità con l’ecosistema Qwen4. Le dichiarazioni tecniche sono rilevanti, ma molti dati su prestazioni e costi provengono da Alibaba o dalla scheda tecnica del modello, non da test indipendenti.
Alibaba descrive Qwen3.8-Flash come un modello multimodale basato su un’architettura mixture of experts (MoE), pensato per programmazione, attività d’ufficio e applicazioni con contesto esteso. L’azienda indica una finestra di contesto predefinita di 262.144 token, espandibile fino a 1 milione di token per file voluminosi, conversazioni molto lunghe e flussi di ricerca. 515
Il prezzo annunciato su QwenCloud è di 0,16 dollari per ogni milione di token in input e 0,47 dollari per ogni milione di token in output. Alibaba aveva comunicato che l’API di produzione sarebbe stata resa disponibile a breve; i successivi resoconti hanno descritto QwenCloud come il servizio che offre il modello a queste tariffe. 415
A questi livelli, Flash è tanto un prodotto infrastrutturale quanto un nuovo modello. Il costo ridotto può rendere più accessibili attività come l’elaborazione di documenti, gli agenti per la programmazione e i flussi di lavoro ad alto volume, senza i prezzi normalmente associati ai modelli di fascia più avanzata.
Flash-Next non è semplicemente un secondo livello dell’API. È un modello open-weight destinato a mostrare alcune delle idee architetturali che Alibaba intende sviluppare per Qwen4. Il repository del modello indica 125 miliardi di parametri per il modello principale, altri 51 miliardi di parametri negli embedding N-gram e appena 6 miliardi di parametri attivati per ogni token.
Si tratta di un’architettura MoE sparsa: il modello dispone di un grande insieme di parametri, ma per ciascun token ne utilizza soltanto una parte. In teoria, questo può ridurre il calcolo necessario per token mantenendo una capacità potenziale superiore a quella di un modello denso di dimensioni comparabili.
La scheda tecnica disponibile riporta una finestra nativa di 262.144 token, estendibile fino a 1 milione tramite YaRN. 13 Poiché Flash e Flash-Next sono rilasci distinti, chi intende usarli dovrebbe comunque verificare nella documentazione di deployment i limiti effettivi, il comportamento del servizio e i requisiti di memoria della versione scelta.
| Caratteristica | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Ruolo principale | Modello cloud per la produzione | Anteprima open-weight dell’architettura Qwen4 |
| Modalità e casi d’uso | Programmazione multimodale, attività d’ufficio e flussi agentici | Programmazione multimodale, attività d’ufficio e compiti agentici di lunga durata |
| Contesto | 262.144 token per impostazione predefinita; espandibile fino a 1 milione | 262.144 token nativi; espansione riportata fino a 1 milione con YaRN |
| Prezzo cloud | 0,16 dollari per milione di token in input; 0,47 dollari per milione in output | Nessun prezzo API Alibaba stabilito per i pesi open-weight |
| Architettura | Alibaba presenta la linea Flash come multimodale e MoE | 125 miliardi di parametri nel modello principale, 51 miliardi negli embedding N-gram e 6 miliardi attivi per token |
| Disponibilità | API di produzione QwenCloud annunciata per il rilascio | Pesi e informazioni della scheda tecnica comparsi alla fine di agosto 2026 |
La tempistica rafforza il legame tra i due prodotti. Il repository e i materiali tecnici di Flash-Next sono comparsi prima o in contemporanea con l’annuncio dell’API di produzione, offrendo agli sviluppatori una prima visione dell’architettura mentre Alibaba preparava il servizio ospitato. 7
Alibaba sostiene che la nuova linea Flash richieda circa un nono del costo di addestramento di Qwen3.7-Plus, offrendo al tempo stesso prestazioni migliori, soprattutto nella programmazione e nelle attività d’ufficio. 515
È una dichiarazione importante, ma va letta come un confronto comunicato dall’azienda e non come uno studio dei costi sottoposto a verifica indipendente. Il costo dell’addestramento dipende, tra gli altri fattori, dal prezzo dell’hardware, dalla durata dei calcoli, dalla preparazione dei dati, dai tentativi falliti e dal metodo contabile utilizzato.
L’architettura sparsa offre comunque una base tecnica plausibile per l’attenzione di Alibaba all’efficienza: per ogni token viene attivata soltanto una frazione dei parametri disponibili. Per chi deve acquistare il servizio, la distinzione pratica è più semplice: il prezzo dell’API è direttamente utile per preparare un budget, mentre il dato “un nono” dovrebbe essere considerato un’indicazione strategica e architetturale finché non saranno disponibili misurazioni esterne comparabili.
La scheda tecnica di Flash-Next riporta i seguenti risultati:
Nella tabella comparativa riprodotta dalla scheda tecnica, Flash-Next ottiene risultati superiori al punteggio riportato per Claude Opus 4.6 Max in SWE-bench Pro, SWE-bench Multilingual, CoWorkBench e JobBench. Per esempio, il confronto indicato è 62,5 contro 53,4 in SWE-bench Pro e 81,0 contro 77,5 in SWE-bench Multilingual.
I dati suggeriscono buone prestazioni nei compiti di ingegneria del software e nelle attività lavorative svolte da agenti. Non dimostrano però che Flash-Next sia migliore di Claude o di tutti gli altri sistemi avanzati in ogni ambito. I numeri sono pubblicati dal fornitore, le configurazioni di valutazione possono differire e i risultati di Flash-Next non vanno automaticamente attribuiti a ogni implementazione produttiva di Qwen3.8-Flash.
Le fonti descrivono Flash-Next come un modello open-weight. Un riepilogo pubblicato indica la licenza qwen-community-1.0, ma gli sviluppatori dovrebbero verificare la licenza applicabile nel repository e nella scheda tecnica ufficiali prima di procedere con ridistribuzione commerciale, fine-tuning o hosting. 6
“Open-weight” non significa necessariamente che ogni utilizzo sia privo di vincoli. La licenza può prevedere condizioni su ridistribuzione, attribuzione, uso accettabile o modelli derivati. Le evidenze disponibili non sono sufficienti per formulare una conclusione più ampia sui permessi commerciali di ogni componente del rilascio.
Il lancio arriva mentre Alibaba sta investendo pesantemente nell’espansione dell’infrastruttura IA. Secondo Reuters, i ricavi trimestrali del cloud sono aumentati del 45%, mentre le spese in conto capitale sono cresciute del 75% e l’utile netto trimestrale è diminuito del 75%. 18
Reuters ha inoltre riferito che Alibaba stava raccogliendo 10 miliardi di dollari attraverso un collocamento azionario a Hong Kong per finanziare i propri piani sull’intelligenza artificiale. Nel complesso, questi dati mostrano il compromesso alla base della strategia Qwen: la domanda di cloud e calcolo per l’IA cresce, ma il costo della costruzione di nuova capacità pesa immediatamente su profitti e flussi di cassa.
In questo contesto, prezzi bassi possono avere un valore strategico anche se comprimono i margini del modello nel breve periodo. Un’inferenza economica poco costosa può aumentare l’utilizzo dell’infrastruttura cloud di Alibaba, attirare carichi di lavoro aziendali e rendere Qwen un’opzione naturale per chi sviluppa applicazioni con contesti molto lunghi.
Con Flash-Next, Alibaba estende la portata di Qwen oltre la propria API. Gli sviluppatori possono scaricare, testare, adattare e ospitare autonomamente il modello, acquisendo familiarità con gli strumenti e l’architettura Qwen senza dover aderire subito a QwenCloud.
Questa distribuzione può aiutare Alibaba in almeno quattro modi:
Le evidenze disponibili sostengono questa lettura strategica, ma non dimostrano che Qwen abbia già conquistato l’ecosistema degli sviluppatori in Cina. Le fonti non forniscono dati verificati e aggiornati su sviluppatori attivi, download o implementazioni aziendali.
Qwen3.8-Flash e Flash-Next vanno letti come due parti di una stessa strategia di prodotto. Flash è il servizio cloud economico con contesto esteso; Flash-Next è il veicolo open-weight per l’ecosistema e per la sperimentazione architetturale in vista di Qwen4.
La combinazione di 0,16 dollari per milione di token in input, contesto fino a 1 milione di token, un percorso con 6 miliardi di parametri attivi all’interno di un modello molto più grande e benchmark pubblicati dal fornitore a favore della programmazione e degli agenti rende il rilascio importante per chi segue l’economia dell’inferenza. 4
Le cautele, però, restano essenziali. Il modello destinato alla produzione e l’anteprima open-weight non devono essere confusi; il dato sul costo di addestramento non è stato verificato in modo indipendente; i confronti nei benchmark sono dichiarazioni del fornitore; e l’adozione non può ancora essere quantificata sulla base delle fonti disponibili.
Alibaba appare quindi un concorrente serio e ben finanziato nella corsa all’intelligenza artificiale in Cina, non un leader incontrastato. La disponibilità a spendere in modo massiccio suggerisce che Qwen sia considerato una scommessa di lungo periodo sul cloud e sull’ecosistema, più che un centro di profitto immediato. 18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Alibaba affianca Qwen3.8 Flash, modello multimodale destinato alla produzione e proposto a 0,16 dollari per milione di token in input e 0,47 dollari in output, a Flash Next, anteprima open weight dell’architettura Qwen4.
Alibaba affianca Qwen3.8 Flash, modello multimodale destinato alla produzione e proposto a 0,16 dollari per milione di token in input e 0,47 dollari in output, a Flash Next, anteprima open weight dell’architettura Qwen4. Flash Next combina un modello principale da 125 miliardi di parametri con 51 miliardi di parametri per gli embedding N gram, attivandone soltanto 6 miliardi per token.
La strategia arriva mentre i ricavi cloud crescono del 45%, ma la spesa in conto capitale aumenta del 75% e l’utile trimestrale diminuisce del 75%.