Tegelijkertijd zoekt DeepSeek open-sourceontwikkelaars voor de gesloten bèta van DeepSeek Harness. Dat framework moet taalmodellen veranderen in AI-agents die zelfstandig taken uitvoeren, context beheren en tools aanroepen .
V4 Flash is de efficiëntiegerichte variant binnen de DeepSeek V4-familie. Het model is bedoeld voor toepassingen waarbij veel verzoeken snel en betaalbaar moeten worden afgehandeld, zoals chat, classificatie, extractie, codehulp en agenttaken.
De architectuur is gebaseerd op Mixture of Experts (MoE). Het model bevat een grote verzameling gespecialiseerde experts, maar gebruikt voor ieder token slechts een deel daarvan. Daardoor combineert het een omvangrijke kennisbasis met een lager actief rekenverbruik per token .
| Eigenschap | Waarde |
|---|---|
| Totaal aantal parameters | 284 miljard |
| Actieve parameters per token | 13 miljard |
| Architectuur | Mixture of Experts (MoE) |
| Contextvenster | 1 miljoen tokens |
| Maximale uitvoer | 384.000 tokens |
| Precisie | Gemengd FP4 + FP8 |
| Licentie | MIT |
| Downloadgrootte | Ongeveer 160 GB |
Bij de repository kan het totale aantal parameters uitkomen op 304 miljard wanneer de gekoppelde DSpark-module voor speculatieve decodering wordt meegerekend .
Zowel V4 Flash als V4 Pro zijn uitgebracht met open gewichten onder de MIT-licentie. Die licentie staat commercieel gebruik, aanpassingen en verspreiding toe zonder royalty's, binnen de voorwaarden van de licentie .
De gewichten zijn beschikbaar via onder meer Hugging Face. Organisaties kunnen het model daardoor op eigen infrastructuur draaien, het aanpassen of in een eigen product verwerken. Dat onderscheidt V4 Flash van veel krachtige modellen die uitsluitend via een gesloten API beschikbaar zijn.
Een contextvenster van 1 miljoen tokens betekent dat het model zeer grote hoeveelheden tekst in één werksessie kan verwerken. Dat is interessant voor lange codebases, omvangrijke documenten en meerstapsagenten, maar vraagt ook veel geheugen en gespecialiseerde hardware.
DeepSeek gebruikt hiervoor een hybride aandachtsarchitectuur met twee mechanismen:
De lagen wisselen CSA en HCA af. Daarnaast blijft een schuivend venster van de laatste 128 onbewerkte tokens beschikbaar, zodat recente informatie niet verloren gaat .
De modelgewichten gebruiken gemengde precisie:
nvidia/DeepSeek-V4-Flash-NVFP4 .Bij FP8 nemen de gewichten van het model alleen al ongeveer 284 GB in beslag. Voor lokaal gebruik met een context van 1 miljoen tokens noemt een deploymentanalyse vier NVIDIA H200 SXM5-gpu's, goed voor in totaal 564 GB videogeheugen, als aanbevolen configuratie . De lage prijs via de API betekent dus niet dat volledige zelfhosting voor iedere ontwikkelaar praktisch haalbaar is.
V4 Flash biedt een instelbare parameter: reasoning_effort. Ontwikkelaars kunnen daarmee een afweging maken tussen snelheid, kosten en redeneerdiepte .
Die flexibiliteit maakt hetzelfde model bruikbaar voor zowel eenvoudige classificatie als codegeneratie en meerstapsplanning .
DeepSeek rekent voor V4 Flash:
Een cache-hit ontstaat bijvoorbeeld wanneer een terugkerende systeemprompt of een veelgebruikte prefix opnieuw wordt verwerkt. Vergeleken met de prijs bij een cache-miss is dat een daling van 98 procent .
Op basis van de aangehaalde vergelijkingen is de uitvoer van V4 Flash 54 keer goedkoper dan Sonnet 4.6 en 107 keer goedkoper dan GPT-5.5 . Verschillende marktanalyses noemen het daarom de goedkoopste frontier-class API die momenteel beschikbaar is .
De productieversie V4-Flash-0731 is volgens DeepSeek vooral verbeterd door aanvullende post-training, niet door een nieuwe architectuur . De officiële updategegevens vermelden onder meer:
DeepSeek zegt dat Flash daarmee op agent- en codeerbenchmarks vergelijkbare prestaties levert als het grotere V4 Pro . De gebruikelijke aanname dat de Pro-variant voor iedere agenttaak automatisch de beste keuze is, wordt daardoor minder vanzelfsprekend . Exacte SWE-bench-scores voor V4-Flash-0731 zijn in de geraadpleegde bronnen niet onafhankelijk bevestigd .
Naast het model werkt DeepSeek aan DeepSeek Harness, een uitvoeringsframework voor AI-agents. Zo'n framework zit als het ware om het taalmodel heen: het kan context beheren, tools aanroepen en een taak opdelen in meerdere stappen .
De naam verscheen op 31 juli in de changelog van V4-Flash-0731 met de mededeling dat Harness binnenkort zou worden uitgebracht . Op 1 augustus begon DeepSeek open-sourceontwikkelaars te werven voor een gesloten bèta . Kandidaten moeten ervaring hebben met projecten rond agent-harnesses en hun GitHub-ID en representatief werk aanleveren .
Cui Tianyi leidt het Harness-team. Volgens de beschikbare berichtgeving werd het team in maart 2026 opgezet nadat Cui bij DeepSeek was gekomen . Een openbare releasedatum voor Harness is nog niet bekendgemaakt .
De inzet van DeepSeek draait om krachtige modellen die goedkoop te gebruiken en breed beschikbaar zijn. De combinatie van open gewichten, een MIT-licentie en API-prijzen van $0,14 voor invoer en $0,28 voor uitvoer past bij de in de industrie beschreven strategie van CEO Liang Wenfeng: betaalbare, capabele modellen ontwikkelen als route richting kunstmatige algemene intelligentie (AGI) .
DeepSeek opereert daarbij in een druk Chinees AI-landschap, met onder meer Alibaba's Qwen-familie, ByteDance's Doubao, Moonshot AI, MiniMax en Z.AI als concurrenten . Volgens meerdere analyses heeft de V4-familie binnen deze prestatielaag een bijzondere positie dankzij de combinatie van open gewichten, een MIT-licentie en een contextvenster van 1 miljoen tokens .
Er zijn ook berichten over mogelijke voorbereidingen voor een beursgang van DeepSeek. Concrete informatie over een datum, begeleidende banken of een officiële aanvraag is echter niet bevestigd .
Niet alle details rond de lancering zijn even stevig onderbouwd. De bronnen bevestigen niet onafhankelijk:
De kern is wel duidelijk: DeepSeek koppelt met V4 Flash een groot maar efficiënt MoE-model aan een zeer lage gebruiksprijs, terwijl Harness de volgende stap richting autonome software-agents moet worden. Voor ontwikkelaars is vooral die combinatie van betaalbare API-toegang en open gewichten relevant — al blijft volledige zelfhosting door de hardware-eisen een gespecialiseerde aangelegenheid.