DeepSeek V4.1 Flash stöder upp till en miljon token i kontext och aktiverar cirka 8 miljarder parametrar per token när indata läses in, mot 16 miljarder när text genereras. Enligt DeepSeek minskar CSA2 och FP4 lagring den globala KV cachen till 890 byte per token, ungefär en fjärdedel av föregångarens.
Publicerad avRedigerad med GPT-6 SolBilder genererade med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
En AI-agent som arbetar länge kan behöva läsa en omfattande historik om och om igen, men bara skriva korta svar. DeepSeek-V4.1-Flash är byggd för just den obalansen. Det är en multimodal MoE-modell med publicerade modellvikter: den kan hantera text och bilder och stöder kontexter på upp till en miljon token. Gränsen säger hur mycket som kan matas in – inte att modellen säkert hittar varje detalj i en lång session. 2
8
Modellens grundstruktur omfattar 552 miljarder parametrar och har en kausal encoder med 20 lager, följd av en decoder med 20 lager. Decoderns globala KV-cache – minnet som används för tidigare information under bearbetningen – byggs utifrån encoderns slutliga tillstånd i stället för separat i varje decoderlager. Enligt DeepSeek aktiveras cirka 8 miljarder parametrar per token när indata läses in (prefill) och 16 miljarder när modellen genererar utdata (decode). Det är särskilt relevant när en agent läser betydligt mer än den skriver. 2
8
CSA2 ger uppmärksamhetslagren ett av tre fasta lägen: Full, Reindex eller Reuse. Lägena gör det möjligt att dela cachelagrad information mellan lager och återanvända val i den glesa uppmärksamhetsmekanismen. Tillsammans med FP4-lagring av den huvudsakliga KV-cachen ger det enligt DeepSeek en global KV-cache på 890 byte per token, ungefär en fjärdedel av motsvarande cache i DeepSeek-V4-Flash. Det är ett mått på cachens storlek, inte ett belägg för att den totala kostnaden sjunker lika mycket i varje driftsmiljö. 6
8
SWA Bounded Replay angriper ett annat lagringsbehov. Metoden återskapar saknade KV-tillstånd genom att köra om bara det senaste fönstret av token, i stället för att behålla tillstånden på SSD. Modellbeskrivningen anger att den beständigt lagrade KV-cachen därmed blir ungefär en åttondel så stor som i V4-Flash. Den siffran avser alltså inte samma cache som jämförelsen med en fjärdedel ovan. 5
9
En modellförteckning beskriver träning från grunden på ett multimodalt material om 45 biljoner token. Enligt samma uppgifter tränades gles uppmärksamhet med sekvenser på 64 000 token, och kontexten utökades till en miljon token vid punkten 34 biljoner token. DeepSeek lyfter också fram nya metoder för förträning och mer omfattande efterträning med förstärkningsinlärning, utan att det citerade materialet ger ett mer detaljerat recept. 9
16
Modellen hanterar bilder och text direkt, och DeepSeek uppger att API-versionen har multimodalt stöd. Det tillgängliga källmaterialet ger däremot inte underlag för en detaljerad bedömning av resultaten på bildtester. 2
16
I DeepSeeks egna utvärderingar presterade basmodellen i nivå med V4-Pro-Base inom kunskap, resonemang och programmering. På separat undanhållna utvärderingar rapporterar företaget 5–10 procents förbättring, trots ungefär en tredjedel så många totala och en fjärdedel så många aktiverade parametrar. DeepSeek uppger även att den släppta modellen överträffar V4-Pro på agentuppgifter, men de citerade utdragen räcker inte för en säker jämförelse test för test. Resultaten bör läsas som rapporterade siffror, inte som ett oberoende jämförande test. 1
16
API-namnet är deepseek-flash, och de publicerade modellvikterna anges ha MIT-licens. Modellmaterialet beskriver driftsättning med SGLang; modellförteckningar nämner även Transformers och vLLM som alternativ för inferens. Kontrollera stödet i den valda driftsmiljön innan du förutsätter att alla funktioner för bilder eller långa kontexter fungerar på samma sätt. 8
9
16
Enligt DeepSeek har V4-Flash och V4-Flash-Vision-Exp tagits ur bruk, medan deras äldre API-namn tillfälligt pekar mot V4.1-Flash. Företaget meddelade också att anrop till deepseek-v4-pro från 14 september 2026 skulle dirigeras till V4.1-Flash till Flash-pris i väntan på V4.1-Pro. Den som är beroende av ett visst Pro-beteende bör därför kontrollera vilken modell som faktiskt besvarar anropen. 16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4.1 Flash stöder upp till en miljon token i kontext och aktiverar cirka 8 miljarder parametrar per token när indata läses in, mot 16 miljarder när text genereras.
DeepSeek V4.1 Flash stöder upp till en miljon token i kontext och aktiverar cirka 8 miljarder parametrar per token när indata läses in, mot 16 miljarder när text genereras. Enligt DeepSeek minskar CSA2 och FP4 lagring den globala KV cachen till 890 byte per token, ungefär en fjärdedel av föregångarens.
Modellen nås via API namnet deepseek flash. Jämförelserna med V4 Pro är rapporterade resultat, inte ett oberoende jämförande test.