| Variante | Parametri Totali | Parametri Attivi | Finestra di Contesto | Output Massimo |
|---|---|---|---|---|
| V4-Pro | 1,6 trilioni (MoE) | ~49B per token | 1 milione di token | 384K token |
| V4-Flash | 284 miliardi (MoE) | ~13B per token | 1 milione di token | 384K token |
Entrambe le varianti sono multimodali (testo, immagine, video), supportano output JSON e chiamate a strumenti, e sono disponibili tramite API e web .
| Variante | Input (non di punta) | Output (non di punta) | Cache Hit |
|---|---|---|---|
| V4-Pro | 0,435 $ | 0,87 $ | 90% di sconto |
| V4-Flash | 0,14 $ | 0,28 $ | 90% di sconto |
DeepSeek ha anche offerto una promozione del 75% su V4-Pro fino ai primi di maggio 2026 . Per fare un paragone, il prezzo di output di GPT-5.5 è di circa 30 $/MTok, il che rende V4-Flash circa 107 volte più economico in output .
I risultati dei benchmark di DeepSeek V4 raccontano una storia articolata:
Importante avvertenza dalla valutazione NIST CAISI (maggio 2026): I benchmark auto-dichiarati da DeepSeek sostengono la parità con GPT-5.4 e Opus 4.6, ma la valutazione indipendente di CAISI ha rilevato che V4 è "sostanzialmente meno capace" su benchmark non pubblici, suggerendo che alcuni punteggi auto-dichiarati potrebbero essere gonfiati . L'Intelligence Index di Artificial Analysis valuta GPT-5.5 (high) a 53 contro DeepSeek V4 Pro (Reasoning, High Effort) a 41* — GPT-5.5 è più intelligente e veloce (69 contro 56 tok/s), ma DeepSeek è drasticamente più economico (0,18 $ contro 4,35 $/MTok in modalità di ragionamento) .
Il team Qwen di Alibaba ha presentato in anteprima Qwen 3.8 Max alla World AI Conference di Shanghai il 19 luglio 2026 . È il primo modello di punta del team con oltre 1 trilione di parametri.
| Attributo | Dettaglio |
|---|---|
| Parametri totali | 2,4 trilioni (MoE sparso) |
| Architettura | Mixture-of-Experts, multimodale (testo + visione confermati) |
| Finestra di contesto | 983.616 token per endpoint Qwen Cloud ; indicata come ~1M in alcune fonti |
| Output massimo | 64.000 token |
| Licenza | Non ancora pubblicata; Alibaba dice open-weight "a breve" |
Nessun prezzo pay-as-you-go è stato pubblicato. L'accesso è attualmente tramite abbonamento attraverso Qwen Chat e partner API selezionati. BenchLM elenca il prezzo di Qwen 3.8 Max Preview come "Non elencato" . Alcuni tracker di terze parti mostrano un prezzo automatico di 1,50 $/5,00 $ per milione di token di input/output, ma ciò non è confermato da Alibaba .
Alibaba dichiara che Qwen 3.8 è "superato solo da Fable 5" (il modello Claude di punta di Anthropic), il che, nella classifica di Alibaba, lo collocherebbe davanti a GPT-5.5 e DeepSeek V4 . Vengono rivendicati miglioramenti nella codifica, nella produttività professionale, nello sviluppo full-stack, nell'analisi dei dati e nei flussi di lavoro da ufficio rispetto a Qwen 3.7 Max .
Tuttavia, nessun benchmark indipendente è stato pubblicato. BenchLM, un sito di tracciamento dei benchmark, monitora 321 benchmark per Qwen 3.8 Max Preview con 0 risultati verificati al 20 luglio 2026 . Come ha osservato un'analisi, "Qwen 3.8 vale la pena di essere testato, ma è troppo presto per trattarlo come un sostituto stabile in produzione per Kimi K3, GPT-5.6 Sol o Claude Fable 5" .
Per contesto, i predecessori di Qwen avevano gettato solide basi: Qwen 3.6-Max-Preview (20 aprile 2026) era un modello solo testo da 35B totali / 3B attivi con contesto 262K che rivendicava il primo posto in sei benchmark di codifica e agenti . Qwen 3.7-Max (maggio 2026) ha ampliato la finestra di contesto a 1 milione di token con capacità di ragionamento agentico . Ma nessuno dei due era generalmente considerato di livello frontier al di fuori della codifica agentica.
Alibaba posiziona esplicitamente Qwen 3.8 come "superato solo da Fable 5" . Se questa affermazione fosse confermata da valutazioni indipendenti, collocherebbe Qwen 3.8 davanti a GPT-5.5 e ben avanti a DeepSeek V4. Ma con zero benchmark verificati, rimane un'affermazione di marketing, non un fatto accertato. Il modello Fable 5 di Anthropic sembra essere l'attuale leader riconosciuto della frontiera secondo la stessa impostazione di Alibaba .
La politica dei prezzi aggressiva di DeepSeek ha innescato una corsa al ribasso sui costi API. V4-Flash a 0,14 $/M input è radicalmente più economico di qualsiasi modello occidentale di frontiera. Alibaba non ha ancora fissato il prezzo di Qwen 3.8, ma Qwen 3.6 era già a un prezzo aggressivo (~1,25 $/7,50 $ input/output) .
La licenza MIT open-weight per DeepSeek V4 significa che è possibile anche l'hosting autonomo, comprimendo ulteriormente i margini per i provider closed-source . Come ha osservato un'analisi, l'effetto pratico è che "gli sviluppatori possono ora accedere a capacità quasi di frontiera (nelle attività di codifica) a una frazione del costo di GPT-5.5 o Claude."