DeepSeek V4 Flash ledet OpenRouters ukesrangering 27. juli–2. På OpenRouter er den daterte V4 Flash 0731 ruten oppført til 0,05 dollar per million input tokens og 0,16 dollar per million output tokens, med et kontekstvindu på 1 310 720 tokens.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek V4-Flash, launched in public API beta on July 31, 2026, become OpenRouter’s most-used model within four days—reaching 7.1 t. Article summary: The reported surge is best explained by an unusually strong cost–capability–context combination, amplified by OpenRouter’s low-friction routing and likely substantial trial traffic—not by architecture alone. But several . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-0731 ble en tydelig demonstrasjon av hvor raskt standardvalgene for språkmodeller kan endres når lav tokenpris, svært stor kontekstkapasitet og enkel tilgang via en modellaggregator kommer samtidig. Modellen toppet OpenRouters ukesrangering for 27. juli–2. august med 7,22 billioner behandlede tokens. Det tallet må likevel tolkes med varsomhet. 5
Dette er særlig attraktivt for arbeidsoppgaver der tokenvolumet fort blir høyt:
MoE-arkitekturen beviser ikke i seg selv lavere kostnad i praktisk bruk eller bedre kvalitet. Den økonomiske ideen er at bare en del av modellens samlede parametere aktiveres per token, slik at kapasiteten kan være stor uten samme beregningsprofil per token som en tett modell med tilsvarende total størrelse. Hvor mye dette betyr i en faktisk løsning, avhenger blant annet av ventetid, leverandørkapasitet, ruting, promptutforming og lengden på svaret.
TechNode rapporterte at DeepSeek V4 Flash behandlet 7,22 billioner tokens på OpenRouter i uken 27. juli–2. august. Ifølge samme rapport tok kinesiske modeller de fire øverste plassene, og DeepSeek V4 Flash 0731 samt V4 Pro var blant de seks øverste. 5
Men uken startet før den offentlige beta-/GA-lanseringen 31. juli. V4 Flash fantes allerede som en forhåndsvisningsrute, mens 0731-utgaven erstattet denne på API-endepunktet deepseek-v4-flash. 3 Ukestotalen bør derfor ikke fremstilles som trafikk skapt utelukkende av den nye versjonen.
Gratis tilgang er et annet vesentlig forbehold. Den samme rapporten oppga at OpenCode behandlet 8 billioner tokens for modellen 1. august: 5 billioner gjennom gratis prøvebruk og 3 billioner betalt av utviklere. 5 Prøvetrafikk kan være strategisk verdifull fordi den senker terskelen for å teste en modell, men den er ikke det samme som varig, betalt produksjonsetterspørsel.
Den mest nøkterne konklusjonen er derfor at V4-Flash fikk svært rask distribusjon og omfattende utprøving. Det foreliggende materialet viser ikke at hele det tidlige volumet kom fra betalte migreringer eller stabil bruk i produksjon.
Prisene varierer mellom leverandører, ruter, rabatter, cache-status og tidspunkt. Dekningen av 31. juli-lanseringen oppga DeepSeeks offisielle pris som 0,14 dollar per million input-tokens uten cache og 0,28 dollar per million output-tokens, mens OpenRouter på ulike tidspunkt har oppgitt andre rutepriser. 3
OpenRouters senere oppføring for den daterte ruten deepseek-v4-flash-0731 viser 0,05 dollar per million input-tokens, 0,16 dollar per million output-tokens og 0,013 dollar per million cache-leste tokens. 1
Med disse oppførte OpenRouter-prisene blir forskjellen mot sammenligningsprisene markant:
| Modell | Oppført input-/outputpris per 1 mill. tokens | Sammenlignet med V4-Flash til 0,05 / 0,16 dollar |
|---|---|---|
| DeepSeek V4-Flash-0731 | 0,05 / 0,16 dollar |
Referanse |
| Kimi K3 | 3 / 15 dollar |
Omtrent 60× / 94× høyere |
| GPT-5.6 Sol | 5 / 30 dollar |
Omtrent 100× / 188× høyere |
| Claude Fable 5 | 10 / 50 dollar |
Omtrent 200× / 313× høyere |
Dette er regnestykker basert på publiserte listepriser, ikke bevis på at modellene gir samme kvalitet, hastighet, verktøypålitelighet, sikkerhetsatferd eller oppetid. Det er heller ikke en universell «pris per oppgave». Den reelle regningen avhenger av mengden input og output, caching, nye forsøk etter feil, verktøykall, leverandør og hvor ofte arbeidsflyten må eskaleres til en annen modell.
Kimi K3, GPT-5.6 Sol og Claude Fable 5 bør ikke behandles som direkte utskiftbare bare fordi alle kan brukes til avansert koding og agentarbeid. Sammenligningskilden beskriver Kimi K3 som en MoE-modell med 2,8 billioner parametere og et kontekstvindu på én million tokens. Den oppgir 1,05 millioner tokens i kontekst for GPT-5.6 Sol og én million for Claude Fable 5. 17
For en kjøper er skillet først og fremst operativt:
Offentlige benchmark-tester kan hjelpe med å lage en kortliste, men én enkelt score avgjør ikke hvilket modellvalg som fungerer i produksjon. Den spesifikke påstanden om 25,2 mot 25,7 i «Agent Ultimate» ble ikke selvstendig underbygget av de oppgitte primærlignende kildene og bør derfor ikke brukes som dokumentasjon på at modellene er nesten likeverdige. DeepSeeks lanseringsmateriale oppgir blant annet 82,7 på Terminal Bench 2.1 og 54,2 på NL2Repo, men også slike resultater må valideres mot den konkrete arbeidsbelastningen. 10
For et mellomstort utviklingsteam er spørsmålet sjelden «hvilken modell vinner en toppliste?». Det er heller: Hvilken modell er pålitelig nok på våre faktiske oppgaver til at besparelsen fortsatt er reell etter kostnaden ved ruting og feil?
En praktisk evaluering kan se slik ut:
Derfor er V4-Flash’ vekst interessant selv om de første token-tallene kan være påvirket av gratis prøvebruk. Den viser hvordan en aggregator med lav terskel kan la utviklere teste et svært rimelig alternativ med stort kontekstvindu umiddelbart. Dersom modellen holder mål i produksjonsevalueringer, kan den flytte rutinevolum bort fra dyrere standardvalg.
Materialet som er oppgitt, underbygger førsteplassen på OpenRouter med 7,22 billioner tokens, overlappen med den tidligere forhåndsvisningsperioden og den rapporterte prøvebrukskomponenten på OpenCode. 3
5 Det underbygger derimot ikke godt nok påstander om at kinesiske modeller tok ni av de ti øverste plassene, at de overgikk amerikansk anropsvolum i 14 uker på rad, at utviklere i USA og Europa migrerte bredt, at reelle inferenskostnader falt med 60–85 prosent, eller at GPT-5.6 Luna gjennomførte et bestemt kutt på 80 prosent.
Slike påstander krever direkte data fra OpenRouters oversikt, prisopplysninger fra leverandørene eller reproduserbare studier av faktiske arbeidslaster. Den dokumenterte lærdommen er smalere: DeepSeek V4-Flash kombinerte uvanlig lave oppførte rutepriser, et stort kontekstvindu og bred tilgang akkurat da utviklere var klare til å teste rimeligere modeller for agenter og programmering. Det er nok til å skape en rask bruksvekst, men ikke alene til å bevise en varig markedsendring.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Flash ledet OpenRouters ukesrangering 27. juli–2.
DeepSeek V4 Flash ledet OpenRouters ukesrangering 27. juli–2. På OpenRouter er den daterte V4 Flash 0731 ruten oppført til 0,05 dollar per million input tokens og 0,16 dollar per million output tokens, med et kontekstvindu på 1 310 720 tokens.
En stor del av den første aktiviteten kan ha vært prøvebruk: OpenCode skal ha behandlet 8 billioner tokens for modellen 1.