La nuova release non cambia dimensioni né architettura rispetto all'anteprima: i miglioramenti dichiarati derivano soprattutto da una fase ulteriore di post-training . Secondo DeepSeek, V4 Flash raggiunge livelli comparabili al più grande V4 Pro nei benchmark dedicati alla programmazione e agli agenti AI .
V4 Flash è il modello della famiglia DeepSeek V4 orientato a velocità, costi contenuti e carichi di lavoro ad alto volume. L'architettura MoE consente al modello di disporre di un ampio insieme di esperti specializzati, attivandone soltanto una parte durante ogni elaborazione.
| Caratteristica | Specifica |
|---|---|
| Parametri complessivi | 284 miliardi |
| Parametri attivi per token | 13 miliardi |
| Parametri del repository con modulo DSpark | 304 miliardi |
| Architettura | Mixture-of-Experts (MoE) |
| Finestra di contesto | 1.000.000 di token |
| Output massimo | 384.000 token |
| Precisione | FP4 + FP8 mista |
| Licenza | MIT |
| Dimensione del download | Circa 160 GB |
I primi checkpoint della famiglia V4 erano stati distribuiti come anteprima nell'aprile 2026; il modello V4-Flash-0731 rappresenta la versione produttiva successiva .
I pesi di V4 Flash e V4 Pro sono distribuiti con una licenza MIT permissiva. In pratica, la licenza consente l'uso commerciale, la modifica e la ridistribuzione senza royalties, nel rispetto dei termini della licenza . I pesi sono disponibili su piattaforme come Hugging Face e possono essere installati su infrastrutture private.
Questo distingue DeepSeek da molti modelli proprietari accessibili soltanto tramite API. Per aziende e sviluppatori significa poter valutare il self-hosting, il fine-tuning e l'integrazione in prodotti commerciali senza dipendere esclusivamente da un fornitore esterno. La disponibilità dei pesi, tuttavia, non elimina i requisiti hardware: un modello da 284 miliardi di parametri resta impegnativo da eseguire localmente.
La finestra di contesto da un milione di token è resa possibile da un sistema di attenzione ibrido che combina due meccanismi di compressione:
Gli strati del modello alternano i due percorsi: quelli pari, a partire dal secondo, usano CSA; quelli dispari, dal terzo in poi, usano HCA. Una finestra scorrevole sugli ultimi 128 token non compressi mantiene l'attenzione sulle informazioni più recenti .
Il risultato è un modello in grado, almeno sul piano dichiarato dell'architettura, di lavorare con documenti, repository di codice e cronologie molto estese senza applicare l'attenzione completa a ogni token della sequenza.
Il checkpoint utilizza una combinazione di formati numerici per ridurre memoria e traffico dati:
nvidia/DeepSeek-V4-Flash-NVFP4 .In FP8, i soli pesi del modello richiedono circa 284 GB. Per un deployment completo con contesto da un milione di token, una configurazione indicata nelle analisi tecniche utilizza quattro GPU NVIDIA H200 SXM5, per un totale di 564 GB di VRAM . Le configurazioni possono cambiare in base a quantizzazione, lunghezza effettiva del contesto e ottimizzazioni del runtime: il fatto che soltanto 13 miliardi di parametri siano attivi per token non significa che l'intero modello possa essere caricato senza tenere conto dei pesi complessivi.
DeepSeek V4 Flash espone il parametro configurabile reasoning_effort, che permette di scegliere quanta elaborazione dedicare alla risposta:
Per chi integra il modello in un prodotto, questa impostazione consente di bilanciare latenza, costo e profondità. Non tutte le richieste hanno bisogno della modalità più lenta: per un flusso ad alto volume, poter usare una modalità rapida può essere importante quanto la qualità massima del modello.
Il listino API di DeepSeek V4 Flash indica:
| Tipo di token | Prezzo per 1 milione |
|---|---|
| Input, cache miss | 0,14 $ |
| Input, cache hit | 0,0028 $ |
| Output | 0,28 $ |
Il prezzo dell'input già presente nella cache equivale a una riduzione del 98% rispetto al prezzo in caso di cache miss . Il vantaggio è particolarmente rilevante per applicazioni che riutilizzano lunghi prompt di sistema, istruzioni comuni o prefissi ripetuti.
Le cifre sono state descritte da più fonti come tra le più basse disponibili nella fascia dei modelli frontier . I confronti con modelli concorrenti dipendono dal listino e dalla data di riferimento: alcune analisi stimano l'output di V4 Flash 54 volte più economico di Sonnet 4.6 e 107 volte più economico di GPT-5.5 .
Il registro ufficiale dell'aggiornamento riporta questi risultati per la versione produttiva:
DeepSeek afferma che il modello raggiunge prestazioni comparabili a V4 Pro nei benchmark di programmazione e nei compiti agentici . La differenza rispetto alla tradizionale distinzione tra versione Pro e versione Flash è quindi meno netta quando il carico di lavoro riguarda uso di strumenti, gestione di repository e attività a più passaggi .
I materiali esaminati non confermano invece un punteggio specifico e indipendente per SWE-bench relativo a V4-Flash-0731 . È quindi preferibile non equiparare automaticamente i risultati dichiarati da DeepSeek a una classifica generale di tutti i modelli di coding.
Parallelamente al rilascio di V4 Flash, DeepSeek sta lavorando su DeepSeek Harness, un framework di esecuzione per agenti. Il software dovrebbe occuparsi di aspetti che vanno oltre la generazione del testo: gestione del contesto, chiamate agli strumenti e completamento autonomo di attività .
Il nome Harness è comparso nel changelog di V4-Flash-0731 con la formula «to be released soon» . Il 1° agosto 2026 DeepSeek ha iniziato a cercare sviluppatori open source per una fase di beta test chiusa. Ai candidati viene richiesto di avere esperienza in progetti collegati agli Agent Harness e di inviare il proprio ID GitHub insieme a lavori rappresentativi .
La squadra dedicata a Harness sarebbe stata costituita nel marzo 2026, quando Cui Tianyi è entrato in DeepSeek per avviare il team . Non è stata però comunicata una data di rilascio pubblico del framework .
La direzione associata al CEO Liang Wenfeng viene spesso descritta come un tentativo di combinare capacità elevate e costi ridotti, anche in vista dell'obiettivo più ampio dell'intelligenza artificiale generale . Il prezzo di V4 Flash e la scelta della licenza MIT sono le manifestazioni più concrete di questa impostazione.
DeepSeek compete in Cina con realtà come Alibaba, attraverso la famiglia Qwen, ByteDance con Doubao, Moonshot AI, MiniMax e Z.AI . La famiglia V4 viene distinta soprattutto per la disponibilità di pesi aperti con licenza MIT e contesto da un milione di token .
Alcune fonti riportano anche presunti preparativi per una futura IPO di DeepSeek, ma non risultano confermati né una tempistica precisa né eventuali sottoscrittori o documenti ufficiali .
Il quadro è ampio, ma alcuni elementi non sono stati confermati in modo indipendente dalle fonti consultate:
Per ora, il dato più rilevante è la combinazione di tre fattori: un modello di grandi dimensioni ma con soli 13 miliardi di parametri attivi per token, una licenza MIT che ne facilita l'utilizzo commerciale e un prezzo API di 0,28 dollari per milione di token in output. Se Harness manterrà le promesse, DeepSeek non starebbe puntando soltanto a rendere più economico il modello, ma anche a controllare lo strato software che trasforma un LLM in un agente capace di portare a termine attività.