For udviklere og virksomheder er kombinationen bemærkelsesværdig: en meget stor model med én million tokens i kontekst, fleksibel ræsonnering, åbne modelvægte og en API-pris på 0,14 dollar pr. million inputtokens og 0,28 dollar pr. million outputtokens .
V4 Flash er den omkostnings- og hastighedsoptimerede model i DeepSeeks V4-familie. Den bruger en MoE-arkitektur, hvor modellen samlet har 284 milliarder parametre, men kun aktiverer omkring 13 milliarder pr. token .
Det betyder i praksis, at modellen har adgang til et stort antal specialiserede ekspertmoduler, uden at alle parametre skal beregnes for hvert eneste input. Det er en af forklaringerne på, at DeepSeek kan kombinere stor modelkapacitet med lave inferensomkostninger.
| Egenskab | Værdi |
|---|---|
| Samlet antal parametre | 284 mia. |
| Parametre aktiveret pr. token | 13 mia. |
| Parametre inkl. DSpark-modul | 304 mia. |
| Arkitektur | Mixture of Experts (MoE) |
| Kontekstvindue | 1.000.000 tokens |
| Maksimal outputlængde | 384.000 tokens |
| Præcision | Blandet FP4 og FP8 |
| Licens | MIT |
| Downloadstørrelse | Cirka 160 GB |
Kilder:
Produktionsudgaven fra juli ændrede ikke modellens grundarkitektur eller størrelse. De rapporterede forbedringer inden for kodning og AI-agenter skyldes i stedet yderligere post-træning .
Både V4 Flash og den større V4 Pro er udgivet med åbne modelvægte under den tilladelige MIT-licens . Licensen tillader blandt andet kommerciel brug, ændringer og videredistribution uden royaltybetalinger.
Modelvægtene kan hentes fra blandt andet Hugging Face og køres på egen infrastruktur. Det gør modellen relevant for virksomheder, der vil have mere kontrol over data, drift og tilpasning end ved brug af en lukket API.
Det er dog vigtigt at skelne mellem åbne modelvægte og en fuldstændig åben AI-tjeneste. Selv om vægtene er tilgængelige, kræver selvhosting stadig betydelig hardware. Ved FP8 fylder modellens vægte alene omkring 284 GB, og en anbefalet konfiguration til fuldt kontekstvindue på én million tokens er fire NVIDIA H200 SXM5-kort med samlet 564 GB VRAM .
Det enorme kontekstvindue bygger på en hybrid opmærksomhedsarkitektur med to mekanismer:
Lagene skifter mellem CSA og HCA. Fra lag 2 anvendes CSA i de lige lag, mens HCA bruges i de ulige lag fra lag 3. Samtidig bevarer modellen et glidende vindue med de seneste 128 rå tokens, så den fortsat har adgang til den nyeste kontekst .
Tilgangen skal gøre det muligt at arbejde med meget lange dokumenter, store kodebaser og flertrinsopgaver uden de samme beregningsomkostninger som ved almindelig fuld opmærksomhed over hele sekvensen.
V4 Flash benytter blandet præcision:
nvidia/DeepSeek-V4-Flash-NVFP4 .Blandet præcision reducerer modelens lager- og VRAM-behov sammenlignet med en tilsvarende model, hvor alt lagres i FP8. Det gør dog ikke selvhosting på almindelig forbrugerhardware ligetil, især ikke hvis man vil bruge hele kontekstvinduet på én million tokens.
Udviklere kan styre, hvor meget beregning modellen skal bruge, via parameteren reasoning_effort. De dokumenterede tilstande er:
Indstillingen gør det muligt at bytte svartid for dybde. En simpel klassifikationsopgave behøver dermed ikke bruge samme beregningsbudget som en kompliceret kode- eller agentopgave .
DeepSeek opkræver 0,14 dollar pr. million inputtokens ved cache-miss og 0,28 dollar pr. million outputtokens . Hvis inputtet genbruges fra cachen – eksempelvis en tilbagevendende systemprompt eller en fælles præfiks – falder inputprisen til 0,0028 dollar pr. million tokens, svarende til en reduktion på 98 procent .
Flere branchekilder beskriver derfor V4 Flash som den billigste API-model i den såkaldte frontier-klasse . Ifølge sammenligninger er output omkring 54 gange billigere end Sonnet 4.6 til 15 dollar pr. million tokens og 107 gange billigere end GPT-5.5 til 30 dollar .
De konkrete udgifter afhænger naturligvis af, hvor meget output en opgave kræver, hvor stor en del af trafikken der rammes af cache, og om modellen køres via DeepSeeks API eller på egen hardware.
DeepSeek oplyser, at produktionsudgaven V4-Flash-0731 har fået markante forbedringer inden for kodning og agentiske arbejdsprocesser. Forbedringerne kommer fra ny post-træning og ikke fra en ny arkitektur .
Den officielle opdateringslog angiver blandt andet følgende resultater:
DeepSeek skriver, at Flash-udgaven nu præsterer på et sammenligneligt niveau med den større V4 Pro på agentiske og kodningsrelaterede benchmarks . Det udfordrer den traditionelle opdeling, hvor en Pro-model forventes at være klart bedre end en Flash-model på alle avancerede opgaver .
Der er ikke fundet uafhængigt bekræftede, præcise SWE-bench-resultater for V4-Flash-0731 i det gennemgåede materiale .
Parallelt med modeludgivelsen bevæger DeepSeek sig længere ind på agentområdet. Den 1. august 2026 begyndte virksomheden at rekruttere open source-udviklere til den lukkede beta af DeepSeek Harness .
Et agent-framework fungerer som laget omkring selve sprogmodellen. Det kan blandt andet håndtere kontekst, vælge og kalde værktøjer samt koordinere de enkelte trin i en opgave. Målet er at gøre en LLM i stand til ikke bare at svare, men også at udføre længerevarende opgaver selvstændigt .
Navnet DeepSeek Harness dukkede første gang op i ændringsloggen til V4-Flash-0731, hvor det blev beskrevet som noget, der snart ville blive udgivet . Ifølge de tilgængelige oplysninger blev det tilknyttede ingeniørteam etableret i marts 2026, da Cui Tianyi kom til DeepSeek for at opbygge teamet .
Udviklere, der vil deltage i betaen, skal have erfaring med relaterede Agent Harness-projekter og indsende deres GitHub-id samt eksempler på tidligere open source-arbejde . Der er endnu ikke annonceret en offentlig udgivelsesdato for Harness .
DeepSeeks strategi forbindes ofte med idéen om at bygge billige, men stærke modeller som et skridt på vejen mod kunstig generel intelligens (AGI) . Den lave API-pris og beslutningen om at udgive modelvægtene under MIT-licensen er de tydeligste praktiske udtryk for denne tilgang.
DeepSeek konkurrerer i Kina med blandt andre Alibaba og Qwen-serien, ByteDance og Doubao, Moonshot AI, MiniMax og Z.AI . V4-familien har ifølge flere kilder en særlig position, fordi den kombinerer åbne vægte, MIT-licens og et kontekstvindue på én million tokens .
Der har også været omtale af, at DeepSeek forbereder en børsnotering, men hverken en konkret tidsplan, tegnede banker eller officielle indleveringsdetaljer er bekræftet i det gennemgåede materiale .
Det tilgængelige materiale giver et detaljeret billede af modellen, men nogle oplysninger bør fortsat behandles med forbehold:
Det mest sikre billede er derfor dette: DeepSeek har lanceret en usædvanligt stor, åben og billig model, der er optimeret til lange kontekster, kodning og agentiske arbejdsgange. Med Harness forsøger virksomheden samtidig at flytte konkurrencen fra selve sprogmodellen til hele systemet omkring den.