Modellen understøtter op til en million tokens i kontekst og aktiverer cirka 8 mia. CSA2, FP4 lagring og SWA Bounded Replay skal mindske behovet for hukommelse og vedvarende lagring i lange sessioner.
Udgivet afRedigeret med GPT-6 SolBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
En AI-agent, der arbejder med en lang samtale eller mange dokumenter, kan bruge langt mere tid på at læse input end på at skrive sit svar. Det er den type arbejde, DeepSeek-V4.1-Flash er indrettet til. Den åbne, multimodale mixture-of-experts-model (MoE) understøtter en kontekst på op til en million tokens. Grænsen fortæller, hvor meget der kan være i konteksten – ikke om modellen sikkert kan finde enhver detalje i en meget lang session. 2
8
Mindre beregning, når input læses. Modellen har en grundarkitektur med 552 mia. parametre, fordelt på en kausal encoder med 20 lag og en decoder med 20 lag. Decoderens globale KV-cache – lagret information, som modellen bruger til at arbejde med tidligere tokens – dannes ud fra encoderens sidste tilstande i stedet for særskilt i hvert decoderlag. Ifølge DeepSeek aktiveres cirka 8 mia. parametre pr. token under prefill, hvor input behandles, og 16 mia. under decode, hvor svaret genereres. Forskellen er især relevant, når en agent læser meget tekst for at producere et forholdsvis kort svar. 2
8
En mindre cache til den lange historik. Teknikken Compressed Sparse Attention 2 (CSA2) giver hvert opmærksomhedslag en af tre faste tilstande: Full, Reindex eller Reuse. Det gør det muligt at dele cachelagret information mellem lag og genbruge valg i den sparsomme opmærksomhed. Sammen med FP4-lagring af den primære KV-cache giver det ifølge DeepSeek et globalt KV-cacheforbrug på 890 byte pr. token – omtrent en fjerdedel af forbruget i DeepSeek-V4-Flash. Det er en sammenligning af cachens størrelse, ikke dokumentation for, at enhver installation bliver fire gange billigere. 6
8
Genberegning frem for varig lagring. SWA Bounded Replay genskaber manglende KV-tilstande til sliding-window attention ved kun at gennemløbe det seneste vindue af tokens igen. Dermed behøver disse tilstande ikke at blive gemt på SSD. DeepSeeks modelbeskrivelse angiver, at den vedvarende KV-cache med denne metode fylder omkring en ottendedel af cachen i V4-Flash. Det tal gælder en anden type lagerforbrug end sammenligningen på en fjerdedel for den globale KV-cache. 5
9
En modelkortoversigt beskriver træning fra bunden på et multimodalt datasæt på 45 billioner tokens. Sparsom opmærksomhed blev trænet ved sekvenser på 64.000 tokens, og konteksten blev udvidet til en million tokens, da træningen havde nået 34 billioner tokens. DeepSeek fremhæver desuden nye metoder til fortræning og mere omfattende eftertræning med reinforcement learning; det citerede materiale beskriver ikke en mere præcis opskrift på eftertræningen. 9
16
Modellen håndterer både tekst og billeder fra starten, og DeepSeek oplyser, at API-udgaven har multimodal understøttelse. De citerede uddrag giver dog ikke grundlag for at vurdere dens billedforståelse ud fra detaljerede benchmarkresultater. 2
16
I DeepSeeks egne evalueringer var basismodellen på niveau med V4-Pro-Base inden for viden, ræsonnement og kodning. På evalueringer holdt uden for træningen rapporterer DeepSeek 5–10 % forbedring, selv om basismodellen bruger cirka en tredjedel så mange samlede parametre og en fjerdedel så mange aktiverede parametre. DeepSeek siger også, at den frigivne model overgår V4-Pro på agentopgaver, men de citerede uddrag rækker ikke til en pålidelig sammenligning benchmark for benchmark. Resultaterne er rapporteret af DeepSeek og er ikke en uafhængig direkte test. 1
16
I DeepSeeks API er modelnavnet deepseek-flash. De offentliggjorte modelvægte er angivet under MIT-licensen. Modelmaterialet beskriver brug med SGLang, mens modeloversigter også nævner Transformers og vLLM som muligheder for inferens. Undersøg kravene til den konkrete opsætning, før du regner med, at alle funktioner til billeder og lang kontekst virker ens på tværs af disse løsninger. 8
9
16
DeepSeek oplyser, at V4-Flash og V4-Flash-Vision-Exp er udfaset, mens de ældre API-navne deepseek-v4-flash og deepseek-v4-flash-vision-exp midlertidigt videresendes til V4.1-Flash. Selskabet meddelte desuden, at kald til deepseek-v4-pro fra 14. september 2026 ville blive sendt til V4.1-Flash til Flash-takster, indtil V4.1-Pro lanceres. Hvis en applikation er afhængig af Pro-modellens særlige adfærd, bør den kontrollere, hvilken model der faktisk besvarer kaldet – ikke blot stole på navnet i forespørgslen. 16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Modellen understøtter op til en million tokens i kontekst og aktiverer cirka 8 mia.
Modellen understøtter op til en million tokens i kontekst og aktiverer cirka 8 mia. CSA2, FP4 lagring og SWA Bounded Replay skal mindske behovet for hukommelse og vedvarende lagring i lange sessioner.
DeepSeeks sammenligninger med V4 Pro er rapporterede resultater, ikke en uafhængig test.