DeepSeek V4 Flash ledde OpenRouters veckorankning den 27 juli–2 augusti med 7,22 biljoner bearbetade tokens, men perioden omfattade även den tidigare förhandsversionen. Den daterade 0731 rutten på OpenRouter listas till 0,05 dollar per miljon indatatokens och 0,16 dollar per miljon utdata tokens, med ett kontextföns...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek V4-Flash, launched in public API beta on July 31, 2026, become OpenRouter’s most-used model within four days—reaching 7.1 t. Article summary: The reported surge is best explained by an unusually strong cost–capability–context combination, amplified by OpenRouter’s low-friction routing and likely substantial trial traffic—not by architecture alone. But several . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-0731 blev ett tydligt exempel på hur snabbt standardvalet av AI-modell kan skifta när tre saker sammanfaller: låga tokenpriser, mycket stort kontextfönster och enkel åtkomst via en modellaggregator. Modellen placerade sig etta i OpenRouters veckorankning för 27 juli–2 augusti med 7,22 biljoner tokens. Det är en anmärkningsvärd siffra – men den måste tolkas försiktigt. 5
Versionen från 31 juli är en gles mixture-of-experts-modell, eller MoE. Den har 284 miljarder parametrar totalt, men aktiverar 13 miljarder parametrar per token. OpenRouter anger ett kontextfönster på 1 310 720 tokens och beskriver modellen som lämpad för programmering, resonemang och agentbaserade arbetsflöden. 1
Kombinationen är särskilt intressant för uppgifter där tokenvolymen snabbt blir stor:
En MoE-arkitektur bevisar däremot inte i sig att en modell blir billigare i praktiken eller bättre på en viss uppgift. Den ekonomiska poängen är att bara en del av modellens totala parametrar används för varje token, vilket är tänkt att ge hög kapacitet utan samma beräkningsprofil per token som en tät modell av motsvarande totalstorlek. Den faktiska nyttan beror ändå på bland annat svarstid, leverantörskapacitet, routning, promptdesign och svarslängd.
TechNode rapporterade att DeepSeek V4 Flash bearbetade 7,22 biljoner tokens på OpenRouter under veckan 27 juli–2 augusti. Enligt samma rapport tog kinesiska modeller de fyra översta placeringarna, medan DeepSeek V4 Flash 0731 och V4 Pro fanns bland de sex främsta. 5
Men veckan började innan den offentliga betaversionen släpptes den 31 juli. V4 Flash fanns redan som en förhandsrutt, och 0731-versionen ersatte den förhandsversionen på API-slutpunkten deepseek-v4-flash. 3 Veckosiffran ska därför inte beskrivas som trafik som enbart skapades av den nya versionen.
Gratisåtkomst är en annan viktig osäkerhetsfaktor. TechNode uppgav också att OpenCode hanterade 8 biljoner tokens för modellen den 1 augusti: 5 biljoner via gratisprov och 3 biljoner som utvecklare betalade för. 5 Provtrafik kan vara strategiskt betydelsefull eftersom den minskar tröskeln för utvärdering, men den är inte samma sak som stabil, betald produktionsefterfrågan.
Den mer hållbara slutsatsen är därför att V4 Flash fick exceptionellt snabb spridning och omfattande testning. Underlaget visar inte att hela den tidiga volymen bestod av betalda migreringar eller långvarig produktionsanvändning.
Priser varierar mellan leverantörer, rutter, rabatter, cachestatus och tidpunkt. I rapporteringen kring släppet den 31 juli angavs DeepSeeks officiella pris till 0,14 dollar per miljon okachade indatatokens och 0,28 dollar per miljon utdata-tokens. OpenRouter visade andra ruttspecifika priser i början av augusti. 3
OpenRouters senare listning för den daterade rutten deepseek-v4-flash-0731 anger 0,05 dollar per miljon indatatokens, 0,16 dollar per miljon utdata-tokens och 0,013 dollar per miljon cachelästa tokens. 1
Med dessa OpenRouter-priser blir skillnaden mot jämförelsemodellerna stor:
| Modell | Listpris för indata/utdata per 1 miljon tokens | Jämfört med V4-Flash på 0,05/0,16 dollar |
|---|---|---|
| DeepSeek V4-Flash-0731 | 0,05/0,16 dollar |
Baslinje |
| Kimi K3 | 3/15 dollar |
Cirka 60×/94× högre |
| GPT-5.6 Sol | 5/30 dollar |
Cirka 100×/188× högre |
| Claude Fable 5 | 10/50 dollar |
Cirka 200×/313× högre |
Detta är matematiska jämförelser av publicerade listpriser, inte bevis för att modellerna levererar samma kvalitet, hastighet, verktygstillförlitlighet, säkerhetsbeteende eller tillgänglighet. Det går heller inte att översätta direkt till ett allmängiltigt pris per utförd uppgift. Kostnaden beror på mängden in- och utdata, cacheanvändning, omförsök, verktygsanrop, leverantör och hur ofta arbetsflödet måste eskaleras till en annan modell.
Kimi K3, GPT-5.6 Sol och Claude Fable 5 är inte utbytbara bara för att de alla kan användas för avancerad programmering och agentuppgifter. Jämförelsekällan beskriver Kimi K3 som en MoE-modell med 2,8 biljoner parametrar och ett kontextfönster på 1 miljon tokens. Den anger 1,05 miljoner tokens för GPT-5.6 Sol och 1 miljon tokens för Claude Fable 5. 17
För den som väljer modell är skillnaden främst operativ:
Offentliga benchmarkresultat kan hjälpa till att välja ut kandidater, men ett enskilt resultat avgör inte vilket modellval som fungerar i produktion. Den specifika jämförelsen 25,2 mot 25,7 på ”Agent Ultimate” är inte självständigt belagd i de tillhandahållna primärnära källorna och bör därför inte användas som bevis för att modellerna är nästan likvärdiga. DeepSeeks eget material redovisar däremot bland annat 82,7 på Terminal Bench 2.1 och 54,2 på NL2Repo – resultat som fortfarande behöver valideras mot den faktiska arbetsbelastningen. 10
För ett medelstort utvecklingsteam är frågan sällan vilken modell som vinner en topplista. Den avgörande frågan är i stället: Vilken modell är tillräckligt tillförlitlig för vår egen arbetsbelastning och sparar samtidigt tillräckligt mycket pengar efter kostnader för routning och misslyckanden?
En praktisk utvärdering kan se ut så här:
Det är därför V4-Flash uppgång spelar roll även om de första tokensiffrorna delvis drevs av provtrafik. En modellaggregator som OpenRouter gör det möjligt att snabbt testa ett mycket billigt alternativ med stort kontextfönster. Om det sedan klarar produktionsutvärderingen kan rutinuppgifter flyttas från dyrare standardmodeller.
Underlaget stödjer förstaplatsen på OpenRouters veckolista med 7,22 biljoner tokens, överlappningen med den tidigare förhandsversionen och den rapporterade andelen gratisprov på OpenCode. 3
5 Det räcker däremot inte för att belägga påståenden om att kinesiska modeller tog nio av de tio första platserna, att de översteg amerikansk anropsvolym i 14 veckor i följd, att utvecklare i USA och Europa migrerade i bred skala, att verkliga inferenskostnader föll med 60–85 procent eller att GPT-5.6 Luna tvingades sänka sitt pris med 80 procent.
Sådana påståenden kräver direktdata från OpenRouters instrumentpanel, prisuppgifter från leverantörer eller reproducerbara studier av verkliga arbetsflöden. Den försiktiga, evidensbaserade slutsatsen är smalare: DeepSeek V4-Flash kombinerade mycket låga listade ruttpriser, stort kontextfönster och bred åtkomst just när utvecklare var redo att pröva billigare modeller för agenter och programmering. Det räcker för att skapa en snabb användningstopp – men inte ensamt för att bevisa en varaktig marknadsförändring.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Flash ledde OpenRouters veckorankning den 27 juli–2 augusti med 7,22 biljoner bearbetade tokens, men perioden omfattade även den tidigare förhandsversionen.
DeepSeek V4 Flash ledde OpenRouters veckorankning den 27 juli–2 augusti med 7,22 biljoner bearbetade tokens, men perioden omfattade även den tidigare förhandsversionen. Den daterade 0731 rutten på OpenRouter listas till 0,05 dollar per miljon indatatokens och 0,16 dollar per miljon utdata tokens, med ett kontextfönster på 1 310 720 tokens.
Gratisprov kan ha förstärkt den tidiga volymen: OpenCode uppges ha hanterat 8 biljoner tokens för modellen den 1 augusti, varav 5 biljoner via gratisprov.