DeepSeek gick över till tidsbaserad prissättning för V4 Flash och V4 Pro klockan 00.00 kinesisk tid den 17 augusti 2026. Under högtrafik kostar utgående token som mest 9 yuan per miljon för V4 Flash och 27 yuan för V4 Pro.
Research answer

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
DeepSeek har gått från en fast prislista till en modell där priset avgörs av när API-plattformen tar emot anropet. Förändringen började gälla klockan 00.00 kinesisk tid den 17 augusti 2026, vilket motsvarar klockan 16.00 UTC den 16 augusti. Lågtrafikpriserna är exakt hälften av högtrafikpriserna, medan de nya nivåerna ligger mellan 50 och 1 100 procent över de tidigare fasta priserna beroende på modell, tokentyp och tidpunkt. 1
2
Den nya prislistan gäller DeepSeek-V4-Flash och DeepSeek-V4-Pro. Högtrafik gäller varje dag under följande tider i Peking:
Alla andra tider räknas som lågtrafik. Det är tidpunkten då DeepSeeks servrar tar emot en begäran som avgör vilket pris som används – inte nödvändigtvis när bearbetningen är klar. Utvecklare som schemalägger jobb behöver därför räkna i kinesisk tid, eller UTC+8. 2
7
Det handlar alltså inte om en jämn prishöjning över hela dygnet. Samma API-anrop kan kosta dubbelt så mycket om det skickas under något av de två högtrafikfönstren.
Beloppen nedan anges i yuan per en miljon token. Cacheträff betyder att en tidigare använd promptdel kan återanvändas. Vid en cachemiss måste indatan bearbetas på nytt och debiteras därför till den högre indataavgiften.
| Modell och tokentyp | Tidigare fast pris | Lågtrafik | Förändring | Högtrafik | Förändring |
|---|---|---|---|---|---|
| V4-Flash, indata med cacheträff | ¥0,02 | ¥0,05 | +150 % | ¥0,10 | +400 % |
| V4-Flash, indata utan cacheträff | ¥1,00 | ¥1,50 | +50 % | ¥3,00 | +200 % |
| V4-Flash, utdata | ¥2,00 | ¥4,50 | +125 % | ¥9,00 | +350 % |
| V4-Pro, indata med cacheträff | ¥0,025 | ¥0,15 | +500 % | ¥0,30 | +1 100 % |
| V4-Pro, indata utan cacheträff | ¥3,00 | ¥4,50 | +50 % | ¥9,00 | +200 % |
| V4-Pro, utdata | ¥6,00 | ¥13,50 | +125 % | ¥27,00 | +350 % |
För V4-Flash bekräftar den dokumenterade prislistan nivåerna ¥0,05, ¥1,50 och ¥4,50 i lågtrafik för cacheträffar, cachemissar och utdata. Under högtrafik stiger de till ¥0,10, ¥3 respektive ¥9. 2 Reuters beskriver de samlade höjningarna för V4-serien som mellan 50 och 1 100 procent, beroende på kategori och tidpunkt.
1
8
Utvärderingar, dokumentindexering, återkörningar, syntetisk datagenerering och andra icke-akuta jobb kan läggas i kö utanför högtrafikfönstren. Eftersom lågtrafikpriset är hälften av högtrafikpriset kan själva schemaläggningen sänka kostnaden avsevärt för jobb som inte kräver omedelbart svar. 2
Tid blir därmed en ny driftparameter för AI-infrastruktur. En kö kan väga samman jobbets deadline med DeepSeeks debiteringsfönster och vänta med bearbetningen utan att byta modell eller minska tokenbudgeten.
Kundsupport, kodassistenter och realtidsagenter körs i regel när användarna är aktiva. De behöver därför oftare acceptera högtrafikpriser. Kostnaderna kan ändå begränsas genom återanvändning av promptar, cachevänlig design, kortare svar och smartare routning mellan modeller.
Cachelagring blir särskilt viktig eftersom cacheträffar på indata fortfarande kostar betydligt mindre än cachemissar för båda modellerna. För tjänster som upprepat skickar samma instruktioner, verktygsdefinitioner eller dokumentkontext kan en högre träffgrad ge större besparing än en mindre minskning av antalet anrop.
Långa resonemang, rapporter och kodsvar förbrukar utdata-token. Under högtrafik kostar de ¥9 per miljon token i Flash och ¥27 i Pro. Utvecklare kan svara med snävare gränser för svarslängden, använda Flash för rutinuppgifter och reservera Pro för jobb där den högre kapaciteten motiverar merkostnaden. 1
2
V4-Pro:s pris för indata med cacheträff under högtrafik är tolv gånger högre än det tidigare fasta priset – den största procentuella ökningen i den nya modellen. Den absoluta kostnaden är fortfarande låg jämfört med okachad indata och utdata, men förändringen blir märkbar för system som behandlar mycket stora mängder återanvända promptar. 1
19
Prisändringen kom efter att DeepSeek-V4-Pro-0813 blev allmänt tillgänglig bakom endpointen deepseek-v4-pro i augusti. De rapporterade specifikationerna beskriver en textmodell med ett kontextfönster på en miljon token, en maximal utdatalängd på 384 000 token och en mixture-of-experts-arkitektur med omkring 1,6 biljoner parametrar totalt, varav cirka 49 miljarder är aktiva för varje token. 29
33
De dokumenterade gränserna för samtidiga anrop skiljer sig också mellan modellerna:
En förfrågan upptar en plats tills hela svaret är färdigt, även vid strömmade svar. 28
Tillsammans pekar pris- och kapacitetsmodellen mot en tydlig produktindelning: Flash passar bättre för rutintrafik med hög genomströmning, medan Pro är en mer kapacitetsbegränsad nivå för krävande resonemang och arbete med stora kontextfönster. Det är en slutsats utifrån de publicerade priserna och gränserna, inte ett direkt påstående om varje användningsfall. 2
28
DeepSeeks förändring liknar efterfrågestyrning för GPU-inferens. Belastningen är ofta högst när interaktiva användare är online, medan många batchjobb kan vänta. Genom att ta mer betalt under dessa perioder och mindre under övrig tid skapas ett incitament att sprida beräkningarna över dygnet.
För utvecklare räcker det därför inte längre att bara välja modell och räkna token. Produktionssystem behöver också avgöra:
Den större betydelsen är ett steg bort från en ren priskamp med fasta API-priser och mot priser som speglar brist på beräkningskapacitet. DeepSeek erbjuder fortfarande en billigare väg för flexibel efterfrågan, men gör samtidigt kostnaden för avancerad inferens mer känslig för när kapaciteten används. Reuters beskriver förändringen som en betydande höjning som varierar mellan modell, tokentyp och användningsperiod – inte som ett enda enhetligt påslag. 1
För team som använder DeepSeek V4 är slutsatsen praktisk: schemaläggning, cachelagring, modellroutning och begränsningar av svarslängden bör behandlas som delar av samma API-kostnadsmodell. Ett jobb som måste köras direkt kan behöva en annan modell eller en snävare tokenbudget. Ett jobb som kan vänta kan däremot behålla en stor del av sin ekonomi genom att köras under lågtrafik.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek gick över till tidsbaserad prissättning för V4 Flash och V4 Pro klockan 00.00 kinesisk tid den 17 augusti 2026.
DeepSeek gick över till tidsbaserad prissättning för V4 Flash och V4 Pro klockan 00.00 kinesisk tid den 17 augusti 2026. Under högtrafik kostar utgående token som mest 9 yuan per miljon för V4 Flash och 27 yuan för V4 Pro.
Modellval, prompt cache, mängden genererad text och möjligheten att skjuta upp jobb blir nu delar av samma kostnadsbeslut.