DeepSeek V4 Flash ha guidato la classifica settimanale di OpenRouter dal 27 luglio al 2 agosto con 7,22 trilioni di token elaborati, ma la settimana includeva anche il precedente percorso preview. Il modello combina 284 miliardi di parametri totali, 13 miliardi attivi per token e una finestra di contesto di 1.310.72...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek V4-Flash, launched in public API beta on July 31, 2026, become OpenRouter’s most-used model within four days—reaching 7.1 t. Article summary: The reported surge is best explained by an unusually strong cost–capability–context combination, amplified by OpenRouter’s low-friction routing and likely substantial trial traffic—not by architecture alone. But several . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-0731 è diventato un caso interessante di quanto rapidamente possano cambiare le preferenze degli sviluppatori quando coincidono tre fattori: prezzi molto bassi per token, contesto enorme e accesso semplice tramite un aggregatore di modelli. Nella classifica settimanale di OpenRouter dal 27 luglio al 2 agosto, DeepSeek V4 Flash è risultato primo con 7,22 trilioni di token elaborati. Il dato è importante, ma va interpretato con qualche cautela. 5
La versione del 31 luglio è un modello mixture-of-experts (MoE) sparso: ha 284 miliardi di parametri totali, ma ne attiva 13 miliardi per ciascun token. OpenRouter indica una finestra di contesto di 1.310.720 token e lo presenta per programmazione, ragionamento e workflow con agenti. 1
È una combinazione molto appetibile quando il volume dei token incide davvero sul budget:
L'architettura MoE, da sola, non prova né un costo operativo inferiore né una qualità superiore. Il suo interesse è soprattutto economico: attivare solo una frazione dei parametri per token mira a offrire capacità elevata senza il profilo di calcolo per token di un modello denso con pari dimensione totale. Nella pratica, però, il vantaggio dipende anche da latenza, capacità del provider, instradamento, progettazione dei prompt e lunghezza delle risposte.
Secondo TechNode, DeepSeek V4 Flash ha elaborato 7,22 trilioni di token su OpenRouter nella settimana dal 27 luglio al 2 agosto. La stessa ricostruzione afferma che i modelli cinesi occupavano le prime quattro posizioni e che V4 Flash 0731 e V4 Pro figuravano fra i primi sei. 5
C'è però una distinzione essenziale: quella settimana era iniziata prima del rilascio in beta pubblica del 31 luglio. V4 Flash esisteva già come percorso preview, mentre la release 0731 ha sostituito quell'anteprima sull'endpoint API deepseek-v4-flash. 3 Il totale settimanale non va quindi raccontato come utilizzo prodotto esclusivamente dalla nuova versione.
Anche l'accesso gratuito sembra un fattore rilevante. Il medesimo report indica che OpenCode ha elaborato 8 trilioni di token per il modello il 1° agosto: 5 trilioni attraverso prove gratuite e 3 trilioni pagati dagli sviluppatori. 5 I trial possono avere un valore strategico perché abbassano la soglia per provare un modello, ma non sono la stessa cosa di una domanda a pagamento, stabile e in produzione.
La conclusione più solida è quindi questa: V4 Flash ha ottenuto una distribuzione e una sperimentazione eccezionalmente rapide. Le fonti disponibili non dimostrano che tutto il volume iniziale corrispondesse a migrazioni pagate o a utilizzo produttivo duraturo.
I prezzi variano secondo provider, percorso di instradamento, sconti, cache e data di rilevazione. Per il rilascio del 31 luglio, la copertura citava un prezzo API ufficiale di 0,14 dollari per milione di token in input non memorizzati in cache e 0,28 dollari per milione di token in output; a inizio agosto OpenRouter mostrava tariffe differenti a seconda del percorso. 3
In una successiva scheda OpenRouter relativa al percorso datato deepseek-v4-flash-0731, i prezzi indicati sono invece 0,05 dollari per milione di token in input, 0,16 dollari per milione in output e 0,013 dollari per milione di token letti dalla cache. 1
Con queste tariffe OpenRouter, il confronto con i prezzi forniti per gli altri modelli è netto:
| Modello | Prezzo di listino input / output per 1 milione di token | Rispetto a V4-Flash a 0,05 / 0,16 dollari |
|---|---|---|
| DeepSeek V4-Flash-0731 | 0,05 / 0,16 dollari |
Riferimento |
| Kimi K3 | 3 / 15 dollari |
Circa 60× / 94× più alto |
| GPT-5.6 Sol | 5 / 30 dollari |
Circa 100× / 188× più alto |
| Claude Fable 5 | 10 / 50 dollari |
Circa 200× / 313× più alto |
Sono confronti aritmetici fra prezzi pubblicati, non una dimostrazione che i modelli offrano qualità, velocità, affidabilità nell'uso degli strumenti, comportamento di sicurezza o disponibilità equivalenti. Non definiscono neppure un costo universale «per attività»: la spesa effettiva dipende da quantità di input e output, cache, tentativi falliti, chiamate a strumenti, provider selezionato e frequenza con cui un flusso deve passare a un modello più costoso.
Kimi K3, GPT-5.6 Sol e Claude Fable 5 non sono intercambiabili solo perché possono essere impiegati per coding avanzato e agenti. La fonte comparativa disponibile descrive Kimi K3 come un MoE da 2,8 trilioni di parametri con contesto da 1 milione di token; per GPT-5.6 Sol riporta 1,05 milioni di token di contesto e per Claude Fable 5 1 milione. 17
Per chi deve scegliere, la distinzione utile è operativa:
I benchmark pubblici possono servire a creare una rosa di candidati, ma un singolo punteggio non dovrebbe decidere il modello predefinito in produzione. Il confronto specifico 25,2 contro 25,7 su “Agent Ultimate” non è stato corroborato in modo indipendente dalle fonti di taglio primario disponibili e non va usato come prova di quasi equivalenza. Il materiale di rilascio DeepSeek riporta, per esempio, 82,7 su Terminal Bench 2.1 e 54,2 su NL2Repo, ma anche questi risultati richiedono una verifica sul carico di lavoro reale. 10
Per un team di sviluppo di medie dimensioni, la domanda raramente è «qual è il modello che vince una classifica?». Piuttosto: quale modello è abbastanza affidabile sul nostro lavoro reale da far risparmiare denaro, anche dopo aver considerato instradamento e costi degli errori?
Una valutazione concreta può seguire cinque passaggi:
Ecco perché l'ascesa di V4-Flash conta anche se le cifre iniziali sono state sostenute dai trial. Mostra come un aggregatore a basso attrito possa permettere agli sviluppatori di provare subito un'opzione a costo molto basso e con contesto esteso. Se l'opzione supera le verifiche in produzione, può spostare il volume delle attività di routine da modelli predefiniti molto più costosi.
Le prove disponibili sostengono il primo posto settimanale su OpenRouter con 7,22 trilioni di token, la sovrapposizione con il precedente periodo preview e la componente di prove gratuite riportata per OpenCode. 3
5 Non sostengono adeguatamente, invece, le affermazioni secondo cui i modelli cinesi avrebbero occupato nove delle prime dieci posizioni, superato il volume di chiamate statunitense per 14 settimane consecutive, generato migrazioni generalizzate di sviluppatori negli Stati Uniti e in Europa, portato a riduzioni reali del costo d'inferenza del 60–85% o causato un taglio specifico dell'80% dei prezzi da parte di GPT-5.6 Luna.
Per affermarlo servirebbero dati diretti della dashboard di OpenRouter, listini dei provider oppure studi riproducibili su carichi di lavoro. Per ora, la lettura supportata dalle evidenze è più circoscritta: DeepSeek V4-Flash ha unito prezzi di instradamento insolitamente bassi, una grande finestra di contesto e ampia accessibilità in un momento in cui gli sviluppatori erano pronti a provare modelli più economici per agenti e coding. È sufficiente a spiegare un rapido picco di utilizzo, ma non basta da solo a dimostrare un riallineamento permanente del mercato.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Flash ha guidato la classifica settimanale di OpenRouter dal 27 luglio al 2 agosto con 7,22 trilioni di token elaborati, ma la settimana includeva anche il precedente percorso preview.
DeepSeek V4 Flash ha guidato la classifica settimanale di OpenRouter dal 27 luglio al 2 agosto con 7,22 trilioni di token elaborati, ma la settimana includeva anche il precedente percorso preview. Il modello combina 284 miliardi di parametri totali, 13 miliardi attivi per token e una finestra di contesto di 1.310.720 token: caratteristiche adatte a coding, agenti e flussi ad alto volume.
Sul percorso datato di OpenRouter, i prezzi indicati sono 0,05 dollari per milione di token in input e 0,16 dollari in output; il vantaggio di listino è enorme, ma non equivale automaticamente a qualità o costo per at...