Pubblicato il 26 agosto 2026, Qwen3.8 Flash Next è un’anteprima tecnica open weight e multimodale dell’architettura destinata a Qwen4, non il modello finale della famiglia. Il sistema combina un modello principale da 125 miliardi di parametri con 51 miliardi di parametri per gli embedding N gram, attivandone circa 6...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Alibaba ha pubblicato Qwen3.8-Flash-Next il 26 agosto 2026, con ulteriori approfondimenti arrivati il giorno successivo. Il modello open-weight non viene presentato come il futuro flagship Qwen4, ma come un’anteprima tecnica ispezionabile dell’architettura che, secondo Qwen, sarà alla base della prossima famiglia. 1
2
15
La sua caratteristica più interessante è il rapporto tra dimensioni complessive e calcolo effettivamente utilizzato: 125 miliardi di parametri nel modello principale, altri 51 miliardi nel componente di embedding N-gram e soltanto circa 6 miliardi di parametri attivati per ogni token. L’obiettivo è mantenere un’elevata capacità rappresentativa senza sostenere, a ogni passaggio, il costo computazionale di un modello denso di pari dimensioni. 4
15
Il nome Qwen3.8-Flash-Next identifica il modello aperto rilasciato da Qwen. Qwen3.8-Flash, invece, indica la variante orientata alla produzione e all’uso tramite API. Le fonti descrivono Qwen3.8-Flash-Next come un sistema multimodale basato sull’architettura MoE, cioè una Mixture of Experts, sviluppata in vista di Qwen4. 1
2
15
La distinzione è importante: non si tratta della conferma che l’intera famiglia Qwen4 sia già stata lanciata. È piuttosto un banco di prova pubblico e un progetto di riferimento per sviluppatori e ricercatori, che possono iniziare a studiare l’architettura, preparare gli strumenti di esecuzione e fornire feedback prima dell’arrivo della nuova generazione. 2
3
15
Il dato sul milione di token va letto con attenzione. La configurazione standard indica un contesto nativo di 262.144 token; la finestra più ampia dipende dall’estensione YaRN e va quindi considerata una modalità estesa, non il limite nativo del modello. 1
4
16
Qwen3.8-Flash-Next combina Gated DeltaNet, o GDN, con Qwen Sparse Attention, o QSA. GDN è progettata per comprimere le informazioni provenienti dal contesto precedente. QSA utilizza invece un indice leggero per individuare e selezionare i microblocchi rilevanti, evitando di applicare la piena attenzione in modo uniforme all’intera cronologia. 4
L’obiettivo è contenere il costo dell’inferenza quando le sequenze diventano molto lunghe. Qwen dichiara fino a 7,6 volte più velocità nella fase di prefill e fino a 4,9 volte più velocità nella decodifica su sequenze da 1 milione di token. Sono tuttavia valori riportati dal produttore: il risultato concreto dipende da hardware, implementazione, lunghezza della sequenza e impostazioni del benchmark. 4
Il componente separato per gli embedding N-gram aggiunge capacità rappresentativa senza richiedere che l’intero insieme di parametri venga elaborato attivamente per ogni token. La progettazione consente inoltre di spostare questa tabella nella memoria del sistema e di precaricare i dati in modo asincrono, sovrapponendo i trasferimenti alla computazione del modello. 4
Per chi gestisce modelli di grandi dimensioni, è un aspetto tutt’altro che secondario. La posizione dei dati in memoria e il loro trasferimento possono incidere sull’economia del sistema quanto il numero nominale di parametri, soprattutto nell’analisi di documenti estesi o nell’elaborazione di grandi batch.
L’anteprima non introduce soltanto un nuovo blocco di attenzione. Qwen riferisce di aver utilizzato l’ottimizzatore Muon, apportando modifiche alla sua interazione con AdamW e alla gestione dei parametri, oltre a una nuova legge di scaling calibrata per questa architettura. 4
Il rilascio è quindi un test pubblico di una ricetta più ampia: combinare una capacità totale molto elevata con una quantità di calcolo attivo relativamente contenuta.
Qwen afferma che l’addestramento di Qwen3.8-Flash ha richiesto circa un nono del costo di Qwen3.7-Plus, a fronte di prestazioni migliori nei compiti di programmazione e nelle attività d’ufficio. Reuters ha riportato le dichiarazioni dell’azienda sulla combinazione tra costi di training inferiori e risultati più forti in queste aree. 1
4
I risultati citati nei materiali di lancio sono:
Alibaba posiziona questi numeri davanti a DeepSeek V4 Flash nel segmento orientato al rapporto tra prestazioni e prezzo. Si tratta però di confronti comunicati dall’azienda: le fonti disponibili non dimostrano che siano stati replicati in modo indipendente con condizioni di valutazione equivalenti. 4
Per l’offerta API di produzione Qwen3.8-Flash, il prezzo indicato è di 1 yuan per milione di token in ingresso e 3 yuan per milione di token in uscita, senza una distinzione tra fasce di punta e fasce non di punta descritta nel materiale di rilascio. I confronti con altri modelli restano legati al caso d’uso: versioni, caching, lunghezza del contesto, livelli del servizio e quantità di output possono cambiare sensibilmente il costo effettivo. 1
4
I pesi aperti permettono di sperimentare Qwen3.8-Flash-Next prima dell’arrivo di Qwen4. Gli sviluppatori possono preparare i sistemi di inferenza, valutare tecniche di quantizzazione e serving e osservare il comportamento del modello sui propri carichi di lavoro, senza dover attendere un’implementazione definitiva della nuova famiglia. 2
3
15
L’architettura appare particolarmente pertinente per:
Sono applicazioni coerenti con il contesto lungo e con il ridotto numero di parametri attivi, non garanzie di superiorità rispetto a ogni alternativa densa o basata sulla piena attenzione. Nella pratica conteranno anche l’hardware, il software di serving, la qualità della quantizzazione, la strategia di recupero delle informazioni e la composizione del carico.
Qwen3.8-Flash-Next è rilevante soprattutto perché rende visibile in anticipo una direzione architetturale. Offre alla comunità un modello concreto per verificare se attenzione sparsa e compressa, grandi embedding ausiliari e un basso numero di parametri attivi possano ridurre il costo dei contesti molto lunghi senza introdurre compromessi eccessivi sulla qualità.
I numeri più ambiziosi del rilascio — velocità, risultati nei benchmark, riduzione dei costi di addestramento e rapporto qualità-prezzo — provengono in larga parte da Qwen o da articoli basati sulle dichiarazioni dell’azienda. Servono quindi test indipendenti su hardware diversi, lingue, lunghezze del contesto, attività multimodali e flussi di lavoro con agenti in produzione.
La conclusione più prudente è anche la più utile: Qwen3.8-Flash-Next non dimostra che Alibaba abbia già creato il modello migliore in assoluto. È un’anteprima tecnica multimodale e open-weight che permette di esaminare molto presto l’architettura su cui Qwen sta preparando Qwen4 — e un progetto verificabile per rendere più efficiente l’intelligenza artificiale alle prese con contesti estremamente lunghi.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pubblicato il 26 agosto 2026, Qwen3.8 Flash Next è un’anteprima tecnica open weight e multimodale dell’architettura destinata a Qwen4, non il modello finale della famiglia.
Pubblicato il 26 agosto 2026, Qwen3.8 Flash Next è un’anteprima tecnica open weight e multimodale dell’architettura destinata a Qwen4, non il modello finale della famiglia. Il sistema combina un modello principale da 125 miliardi di parametri con 51 miliardi di parametri per gli embedding N gram, attivandone circa 6 miliardi per token.
Il contesto nativo è di 262.144 token, estendibile fino a 1 milione tramite YaRN; Alibaba segnala inoltre importanti vantaggi di velocità e costi, ancora da verificare con test indipendenti.