V4 Flash är den mer effektivitetsinriktade modellen i DeepSeeks V4-familj. Den är tänkt för arbetslaster där hög genomströmning, låg svarstid och låga kostnader är viktigare än maximal modellstorlek.
MoE-arkitekturen innebär att modellen har tillgång till ett stort antal specialiserade experter, men bara använder en del av dem för varje token. Resultatet är en modell med 284 miljarder totala parametrar, där 13 miljarder parametrar aktiveras per token . Om den medföljande DSpark-modulen för spekulativ avkodning räknas in uppgår det totala antalet parametrar i modellarkivet till 304 miljarder .
| Egenskap | Värde |
|---|---|
| Totalt antal parametrar | 284 miljarder |
| Aktiva parametrar | 13 miljarder per token |
| Arkitektur | Mixture of Experts (MoE) |
| Kontextfönster | 1 000 000 tokens |
| Maximal output | 384 000 tokens |
| Precision | Blandad FP4 och FP8 |
| Licens | MIT |
| Nedladdningsstorlek | Cirka 160 GB |
Källor:
Både V4 Flash och den större V4 Pro har släppts med MIT-licens. Det innebär i praktiken att modellvikterna får användas kommersiellt, ändras och distribueras vidare utan royaltybetalningar, med de villkor som följer av MIT-licensen .
Vikterna finns på Hugging Face och kan köras på egen infrastruktur. För organisationer som vill behålla data i en privat miljö är det en viktig skillnad jämfört med API-tjänster där all inferens sker hos en extern leverantör.
DeepSeek V4 sticker dessutom ut genom att erbjuda ett kontextfönster på 1 miljon tokens tillsammans med öppna modellvikter och en tillåtande MIT-licens .
En kontext på 1 miljon tokens är kostsam att hantera med traditionell attention. V4 Flash kombinerar därför två komprimeringsmetoder: Compressed Sparse Attention (CSA) och Heavily Compressed Attention (HCA).
Lagerstrukturen växlar mellan metoderna: från och med lager 2 används CSA i jämna lager och från och med lager 3 används HCA i udda lager. En separat glidande fönstergren över de senaste 128 råa tokensen finns hela tiden kvar för att modellen ska kunna prioritera nyligt innehåll .
Modellens checkpoint använder blandad precision för att minska lagrings- och minnesbehovet:
nvidia/DeepSeek-V4-Flash-NVFP4 .I ren FP8 skulle modellvikterna kräva ungefär 284 GB. För självhostning med hela kontextfönstret på 1 miljon tokens anges fyra NVIDIA H200 SXM5 som rekommenderad minimikonfiguration, med totalt 564 GB VRAM . Det gör modellen betydligt mer tillgänglig via API än som lokal installation – även om hårdvarukraven fortfarande är höga för den som vill drifta den själv.
V4 Flash har parametern reasoning_effort, som låter utvecklare välja hur mycket beräkningsarbete modellen ska lägga på resonemanget:
Funktionen ger utvecklare möjlighet att väga svarstid mot analysdjup. En enkel klassificeringsuppgift behöver inte använda samma beräkningsbudget som fler stegs kodgenerering eller agentbaserad planering .
DeepSeek tar 0,14 dollar per miljon indatatokens när cachen inte träffar och 0,28 dollar per miljon utdatatokens . För cachade indata – exempelvis återkommande systemprompter eller gemensamma promptprefix – sjunker priset till 0,0028 dollar per miljon tokens, en minskning med 98 procent .
Flera prisjämförelser beskriver V4 Flash som den billigaste frontier-modellens API-tjänst på marknaden. Som jämförelse uppges utdatat vara 54 gånger billigare än Sonnet 4.6, med ett pris på 15 dollar per miljon tokens, och 107 gånger billigare än GPT-5.5, med 30 dollar per miljon tokens .
Det låga priset är särskilt relevant för arbetslaster där modellen anropas ofta: kodassistans, klassificering, informationsutvinning, verifiering och långvariga agentflöden.
Produktionsversionen V4-Flash-0731 ska enligt DeepSeeks uppdateringslogg ha fått tydliga förbättringar inom agentbaserade uppgifter och kodning. Förändringarna kom genom ytterligare träning efter den ursprungliga modellutformningen, inte genom en ny arkitektur .
De rapporterade resultaten omfattar:
DeepSeek uppger att Flash-versionen nu presterar på jämförbar nivå med den större V4 Pro i agent- och kodbenchmarktester . Det innebär att den traditionella uppdelningen där Pro står för kvalitet och Flash för lägre kostnad blir mindre tydlig i just agentbaserade arbetslaster .
Exakta SWE-bench-resultat för V4-Flash-0731 har däremot inte kunnat bekräftas i det granskade materialet .
Den andra stora nyheten är DeepSeek Harness. Ramverket är tänkt att ligga utanför själva språkmodellen och ansvara för sådant som kontexthantering, verktygsanrop och genomförande av uppgifter .
Namnet dök först upp i ändringsloggen för V4-Flash-0731 den 31 juli, där det beskrevs som något som skulle släppas snart . Den 1 augusti började DeepSeek rekrytera utvecklare av projekt med öppen källkod till ett stängt betatest . Något offentligt releasedatum har inte meddelats .
För att ansöka behöver utvecklare ha erfarenhet av projekt kopplade till agentramverk och skicka in sitt GitHub-ID samt representativa projekt .
Harness-teamet etablerades i mars 2026 när Cui Tianyi anslöt till DeepSeek för att bygga gruppen från grunden . Uppgifter om hans tidigare roller på TSY Capital och Jane Street kommer däremot från en enskild källa och har inte kunnat verifieras oberoende.
DeepSeeks vd Liang Wenfeng förknippas i branschbevakningen med en strategi där billiga och kapabla modeller ses som en väg mot artificiell generell intelligens, AGI . De mest konkreta uttrycken för strategin är modellernas låga API-priser och beslutet att publicera öppna vikter under MIT-licens .
DeepSeek konkurrerar på den kinesiska marknaden med bland andra Alibaba och Qwen-serien, ByteDance och Doubao, Moonshot AI, MiniMax och Z.AI . V4-familjen har samtidigt en särskild position genom kombinationen av öppna vikter, MIT-licens och ett kontextfönster på 1 miljon tokens .
Det har också förekommit uppgifter om att DeepSeek förbereder en börsnotering. Något bekräftat datum, någon offentlig tidsplan eller namngivna emissionsgaranter har dock inte kunnat fastställas .
Det samlade materialet ger en tydlig bild av V4 Flash, men vissa uppgifter bör behandlas försiktigt:
Den säkraste slutsatsen är därför mer avgränsad: DeepSeek V4 Flash är en stor men selektivt aktiverad MoE-modell med öppna MIT-licensierade vikter, lång kontext, konfigurerbart resonemang och ovanligt låg API-kostnad. DeepSeek Harness visar samtidigt att företaget inte bara vill sälja modellåtkomst – utan också bygga verktygen runt AI-agenterna.