DeepSeek V4.1 Flash supporta contesti fino a un milione di token, ma questa soglia non garantisce che recuperi ogni dettaglio di una sessione lunga. Attiva circa 8 miliardi di parametri per token nella lettura dell’input e 16 miliardi nella generazione; DeepSeek dichiara una cache KV globale di 890 byte per token.
Pubblicato daModificato con GPT-6 SolImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Per un agente AI che consulta una lunga cronologia prima di rispondere, la dimensione massima del contesto è solo metà della questione: conta anche quanta memoria serve per conservarlo e quanto lavoro richiede leggerlo. DeepSeek-V4.1-Flash è un modello multimodale a pesi disponibili pubblicamente, basato su un’architettura mixture-of-experts (MoE), che supporta fino a un milione di token di contesto. Il limite dichiarato, però, non equivale alla capacità garantita di ritrovare ogni informazione in una sessione così lunga. 2
8
Legge con meno calcolo di quanto ne usi per scrivere. Il modello ha un’architettura di base da 552 miliardi di parametri, organizzata in 20 livelli di encoder causale seguiti da 20 livelli di decoder. La cache key–value (KV), che conserva informazioni utili sui token già elaborati, viene ricavata dagli stati finali dell’encoder anziché essere prodotta separatamente da ogni livello del decoder. Secondo DeepSeek, il modello attiva circa 8 miliardi di parametri per token nel prefill — l’elaborazione dell’input — e 16 miliardi nel decode, quando genera la risposta. È una distinzione importante per gli agenti che leggono molto più testo di quanto ne producano. 2
8
Conserva una cache globale più piccola. Il sistema di attenzione Compressed Sparse Attention 2 (CSA2) assegna ai livelli una di tre modalità fisse, Full, Reindex o Reuse, per condividere informazioni della cache e riutilizzare selezioni dell’attenzione sparsa. Insieme alla memorizzazione FP4 della cache KV principale, porta l’ingombro dichiarato della cache KV globale a 890 byte per token, circa un quarto di quello di DeepSeek-V4-Flash. È un confronto sulla memoria occupata dalla cache, non una misura del risparmio complessivo in ogni installazione. 6
8
Ricostruisce alcuni stati invece di salvarli. Con SWA Bounded Replay, gli stati KV mancanti dell’attenzione a finestra mobile vengono rigenerati rielaborando soltanto la finestra più recente di token, senza doverli conservare su SSD. La scheda del modello indica così un ingombro della cache KV persistente pari a circa un ottavo di quello di V4-Flash. Questo dato riguarda l’archiviazione persistente e non va confuso con il confronto, pari a un quarto, sulla cache globale. 5
9
Una scheda del modello descrive un addestramento da zero su un corpus multimodale di 45 mila miliardi di token, con addestramento dell’attenzione sparsa su sequenze da 64.000 token ed estensione del contesto a un milione di token quando l’addestramento aveva raggiunto 34 mila miliardi di token. DeepSeek attribuisce inoltre i miglioramenti a nuovi metodi di pre-addestramento e a una successiva fase di apprendimento per rinforzo su scala maggiore; le fonti citate non ne precisano ulteriormente la procedura. 9
16
Il modello gestisce nativamente testo e immagini, e DeepSeek indica il supporto multimodale anche per la versione API. Gli estratti disponibili non consentono, però, di valutare nel dettaglio i risultati nei benchmark visivi. 2
16
Nelle valutazioni di DeepSeek, la versione base risulta comparabile a V4-Pro-Base per conoscenze, ragionamento e programmazione, con miglioramenti del 5–10% in valutazioni su dati tenuti da parte, pur usando circa un terzo dei parametri totali e un quarto di quelli attivati. L’azienda afferma anche che il modello rilasciato supera V4-Pro nei compiti svolti da agenti AI, ma gli estratti citati non permettono un confronto affidabile benchmark per benchmark. Sono risultati comunicati da DeepSeek, non una verifica indipendente. 1
16
Nell’API il nome da usare è deepseek-flash. I pesi pubblicati sono indicati con licenza MIT; i materiali del modello descrivono un percorso di utilizzo con SGLang, mentre le schede elencano anche Transformers e vLLM. Prima di scegliere un ambiente di esecuzione, è opportuno verificarne il supporto effettivo per le funzioni multimodali e i contesti lunghi. 8
9
16
DeepSeek dichiara ritirati V4-Flash e V4-Flash-Vision-Exp: i rispettivi vecchi nomi API vengono temporaneamente instradati verso V4.1-Flash. Ha inoltre annunciato che, dal 14 settembre 2026, anche le richieste a deepseek-v4-pro sarebbero state indirizzate a V4.1-Flash alle tariffe Flash, in attesa di V4.1-Pro. Per le applicazioni che dipendono dal comportamento specifico di Pro, conviene verificare quale modello risponde davvero, senza dedurlo dal solo nome usato nella richiesta. 16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4.1 Flash supporta contesti fino a un milione di token, ma questa soglia non garantisce che recuperi ogni dettaglio di una sessione lunga.
DeepSeek V4.1 Flash supporta contesti fino a un milione di token, ma questa soglia non garantisce che recuperi ogni dettaglio di una sessione lunga. Attiva circa 8 miliardi di parametri per token nella lettura dell’input e 16 miliardi nella generazione; DeepSeek dichiara una cache KV globale di 890 byte per token.
Il modello è disponibile nell’API come deepseek flash. I confronti prestazionali citati provengono da DeepSeek, non da una verifica indipendente.