Samtidig har selskapet invitert utviklere av åpen kildekode til lukket betatesting av DeepSeek Harness, et rammeverk for AI-agenter som skal håndtere kontekst, verktøykall og flertrinnsoppgaver .
V4 Flash er den mer effektive modellen i DeepSeek V4-familien. Den er laget for bruksområder der høy gjennomstrømming, lav ventetid og lave kostnader er viktigere enn maksimal modellstørrelse.
| Egenskap | Verdi |
|---|---|
| Totalt antall parametere | 284 milliarder |
| Aktive parametere per token | 13 milliarder |
| Arkitektur | Mixture of Experts (MoE) |
| Kontekstvindu | 1 million tokens |
| Maksimal output | 384 000 tokens |
| Presisjon | Blandet FP4 og FP8 |
| Lisens | MIT |
| Nedlastingsstørrelse | Omtrent 160 GB |
En MoE-modell har mange spesialiserte «eksperter», men aktiverer bare et utvalg av dem for hvert token. Resultatet er at modellen kan ha tilgang til et svært stort parameterlager uten at alle parametrene må brukes i hver eneste beregning .
Både V4 Flash og den større V4 Pro er publisert med åpne vekter under MIT-lisensen . Det innebærer i utgangspunktet at utviklere kan bruke modellene kommersielt, endre dem, videreformidle dem og kjøre dem på egen infrastruktur uten royaltybetalinger.
Vektene er tilgjengelige gjennom blant annet Hugging Face. For virksomheter kan dette gjøre det mulig å selvhoste modellen i et privat miljø, selv om maskinvarekravene fortsatt er betydelige.
Den lange konteksten bygger på en hybrid oppmerksomhetsarkitektur med to sentrale mekanismer:
Lagene veksler mellom CSA og HCA. Samtidig beholdes et glidende vindu med de siste 128 rå tokens, slik at modellen fortsatt har tilgang til den nyeste informasjonen .
V4 Flash bruker blandet presisjon for å redusere størrelsen på modellvektene:
Ved ren FP8-presisjon vil modellvektene alene kreve rundt 284 GB minne. For selvhosting med full kontekst på 1 million tokens anbefales en konfigurasjon med fire NVIDIA H200 SXM5-kort, som til sammen har 564 GB VRAM . Det betyr at «åpen» ikke nødvendigvis betyr enkelt eller billig å kjøre lokalt for mindre utviklerteam.
Utviklere kan styre hvor mye beregning modellen skal bruke gjennom parameteren reasoning_effort :
Dette gir en praktisk avveining mellom hastighet, kostnad og dybde. En enkel klassifiseringsjobb trenger ikke samme beregningsbudsjett som avansert kodegenerering eller agentbasert planlegging .
DeepSeek tar 0,14 dollar per million input-tokens ved cache-miss og 0,28 dollar per million output-tokens . For gjenbrukte promptdeler, for eksempel faste systeminstruksjoner, faller inputprisen til 0,0028 dollar per million tokens – en reduksjon på 98 prosent .
Flere bransjekilder omtaler derfor V4 Flash som den billigste API-modellen i toppklassen. Outputprisen er oppgitt til å være 54 ganger lavere enn Sonnet 4.6, til 15 dollar per million tokens, og 107 ganger lavere enn GPT-5.5, til 30 dollar .
Prisene gjør særlig forskjell for tjenester som sender store mengder forespørsler: kodeassistenter, dokumentbehandling, klassifisering, datauttrekk og AI-agenter som må gjøre mange verktøykall.
Produksjonsversjonen V4-Flash-0731 skal ha fått bedre resultater gjennom ny ettertrening, ikke gjennom en ny arkitektur . DeepSeeks oppdateringslogg oppgir blant annet disse resultatene:
DeepSeek skriver at modellen nå presterer på sammenlignbart nivå med den større V4 Pro på agent- og kodebenchmarkene . Det utfordrer den vanlige antakelsen om at «Pro» automatisk er best for alle krevende arbeidsflyter .
Samtidig er det viktig å være presis: De gjennomgåtte kildene bekrefter ikke noen entydig, uavhengig SWE-bench-score for V4-Flash-0731 .
DeepSeek tester også et nytt produktlag rundt modellene. DeepSeek Harness beskrives som et rammeverk for agentkjøring som ligger utenfor selve språkmodellen. Det skal blant annet kunne:
Navnet dukket først opp i endringsloggen for V4-Flash-0731, med meldingen om at det skulle lanseres snart . 1. august 2026 begynte DeepSeek å rekruttere utviklere av open source-prosjekter til lukket betatesting . Søkerne må ha erfaring med Agent Harness-relaterte prosjekter og sende inn GitHub-ID samt eksempler på arbeid .
Cui Tianyi leder Harness-teamet. Kildene oppgir at teamet ble etablert i mars 2026, da Cui begynte i DeepSeek . På det nåværende tidspunktet er det ikke bekreftet noen offentlig lanseringsdato for Harness .
DeepSeeks strategi kan oppsummeres i tre ord: billig, kapabel og åpen. V4 Flash kombinerer en permissiv lisens med svært lave API-priser og støtte for lange kontekster. Det kan presse konkurrentene til å redusere prisene eller tilby mer fleksible modeller.
DeepSeek konkurrerer i Kina blant annet med Alibaba og Qwen-serien, ByteDance og Doubao, Moonshot AI, MiniMax og Z.AI . V4-familien skiller seg ut ved at den er en åpen modellserie i denne ytelsesklassen med MIT-lisens .
Selskapets toppsjef Liang Wenfeng forbindes i bransjedekningen med en strategi der billige, sterke modeller skal bidra til utviklingen mot kunstig generell intelligens, eller AGI . Prisnivået og open-weight-modellen er den tydeligste praktiske manifestasjonen av denne strategien, selv om de gjennomgåtte kildene ikke inneholder en direkte, verifisert uttalelse fra Liang om dette.
Det finnes også rapporter om at DeepSeek forbereder en børsnotering, men konkrete datoer, tilretteleggere og bekreftede innsendelser er ikke dokumentert i kildematerialet .
Noen detaljer bør derfor behandles med forsiktighet:
Det viktigste bildet er likevel klart: DeepSeek forsøker å flytte konkurransen fra bare større modeller til mer effektiv infrastruktur, lavere kostnader og AI-agenter som faktisk kan utføre oppgaver.