DeepSeek V4.1 Flash ondersteunt maximaal een miljoen tokens context en activeert per token circa 8 miljard parameters bij het verwerken van invoer, tegenover 16 miljard bij het genereren van uitvoer. CSA2, FP4 opslag en SWA Bounded Replay verkleinen volgens DeepSeek de geheugen en opslagvoetafdruk van de KV cache; d...
Gepubliceerd doorBewerkt met GPT-6 SolAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Een AI-agent die een lange gespreksgeschiedenis of grote hoeveelheden bronmateriaal leest, besteedt veel werk aan invoer voordat hij antwoord geeft. DeepSeek-V4.1-Flash is voor zulke sessies ontworpen: dit open-weight, multimodale mixture-of-experts-model (MoE) ondersteunt een context van maximaal een miljoen tokens en probeert de verwerking en opslag daarvan minder belastend te maken. Die limiet zegt hoeveel context het model kan verwerken, niet dat het elk detail uit een lange sessie feilloos terugvindt. 2
8
De basisarchitectuur telt 552 miljard parameters en bestaat uit een causale encoder met 20 lagen, gevolgd door een decoder met 20 lagen. De globale key-value-cache (KV-cache) van de decoder wordt afgeleid van de eindtoestand van de encoder, in plaats van afzonderlijk door iedere decoderlaag te worden opgebouwd. De KV-cache bewaart informatie die het model nodig heeft om bij volgende tokens naar eerdere invoer te kunnen verwijzen. 2
8
Volgens DeepSeek zijn tijdens prefill — het verwerken van de invoer — ongeveer 8 miljard parameters per token actief. Tijdens decode, het genereren van uitvoer, zijn dat er 16 miljard. Dat verschil is vooral relevant voor agents die veel tekst lezen en relatief korte antwoorden produceren. 2
8
Met Compressed Sparse Attention 2 (CSA2) krijgt elke aandachtslaag een van drie vaste modi: Full, Reindex of Reuse. Daardoor kunnen lagen cache-informatie en selecties voor schaarse aandacht hergebruiken. In combinatie met FP4-opslag voor de belangrijkste KV-cache komt de globale cache volgens DeepSeek uit op 890 bytes per token: ongeveer een kwart van de voetafdruk van DeepSeek-V4-Flash. Dat is een vergelijking van cachegeheugen, geen gemeten besparing op de totale kosten van elke toepassing. 6
8
Daarnaast gebruikt het model SWA Bounded Replay. Daarbij worden ontbrekende KV-toestanden voor sliding-window attention opnieuw opgebouwd door alleen de recentste reeks tokens nogmaals te verwerken. Die toestanden hoeven daardoor niet op een SSD bewaard te blijven. De modelbeschrijving noemt voor deze permanente opslag een KV-cachevoetafdruk van ongeveer een achtste van die van V4-Flash. Dat is dus een andere maatstaf dan het kwart voor de globale cache. 5
9
Een modeloverzicht beschrijft training vanaf nul op een multimodale dataset van 45 biljoen tokens. De training met schaarse aandacht gebruikte reeksen van 64.000 tokens; bij het punt van 34 biljoen tokens werd de context uitgebreid naar een miljoen tokens. DeepSeek schrijft verdere verbeteringen toe aan nieuwe pretrainingmethoden en grootschaligere natraining met reinforcement learning. De aangehaalde informatie onderbouwt geen gedetailleerder recept voor die natraining. 9
16
Het model kan van nature tekst en beelden verwerken; DeepSeek zegt dat ook de API-versie multimodale ondersteuning biedt. De beschikbare bronfragmenten geven geen gedetailleerde resultaten voor benchmarks voor beeldverwerking. 2
16
In DeepSeeks eigen evaluaties presteert het basismodel op kennis, redeneren en programmeren vergelijkbaar met V4-Pro-Base. Op apart gehouden evaluaties meldt het bedrijf verbeteringen van 5 tot 10%, met ongeveer een derde van het totale aantal parameters en een kwart van het aantal actieve parameters. DeepSeek stelt ook dat het uitgebrachte model V4-Pro overtreft op agenttaken. De aangehaalde fragmenten bieden daarvoor geen betrouwbare vergelijking per benchmark: dit zijn gerapporteerde resultaten, geen onafhankelijke rechtstreekse test. 1
16
Voor de DeepSeek-API is de modelnaam deepseek-flash. De gepubliceerde gewichten staan vermeld onder de MIT-licentie. De modeldocumentatie beschrijft gebruik via SGLang; modeloverzichten noemen ook ondersteuning voor inferentie met Transformers en vLLM. Controleer per runtime of de gewenste multimodale functies en lange context daadwerkelijk op dezelfde manier worden ondersteund. 8
9
16
Volgens DeepSeek zijn V4-Flash en V4-Flash-Vision-Exp uitgefaseerd. Hun oudere API-namen verwijzen tijdelijk door naar V4.1-Flash. DeepSeek kondigde bovendien aan dat verzoeken aan deepseek-v4-pro vanaf 14 september 2026 naar V4.1-Flash worden geleid tegen Flash-tarieven, in afwachting van V4.1-Pro. Wie afhankelijk is van specifiek Pro-gedrag, kan daarom beter controleren welk model een verzoek werkelijk afhandelt dan op de alias afgaan. 16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4.1 Flash ondersteunt maximaal een miljoen tokens context en activeert per token circa 8 miljard parameters bij het verwerken van invoer, tegenover 16 miljard bij het genereren van uitvoer.
DeepSeek V4.1 Flash ondersteunt maximaal een miljoen tokens context en activeert per token circa 8 miljard parameters bij het verwerken van invoer, tegenover 16 miljard bij het genereren van uitvoer. CSA2, FP4 opslag en SWA Bounded Replay verkleinen volgens DeepSeek de geheugen en opslagvoetafdruk van de KV cache; de genoemde verhoudingen meten niet allemaal hetzelfde.
De prestatievergelijkingen komen van DeepSeek. Voor de API is deepseek flash de modelnaam, terwijl oudere namen tijdelijk kunnen doorverwijzen.