DeepSeek gikk over til tidsbasert prising for V4 Flash og V4 Pro klokken 00.00 Beijing tid 17. Toppperiodene er 09.00–12.00 og 14.00–18.00 Beijing tid hver dag.
Research answer

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
DeepSeek har gått bort fra én fast pris for V4-API-et. Fra klokken 00.00 Beijing-tid 17. august 2026 – tilsvarende klokken 16.00 UTC 16. august – varierer prisen etter tidspunktet på døgnet. Lavtrafikkprisene er nøyaktig halvparten av prisene i toppperiodene. 1
2
For utviklere betyr det at en API-forespørsel ikke bare må vurderes ut fra hvilken modell og hvor mange tokens den bruker. Tidspunktet og kinesisk tidssone er nå også en del av regnestykket.
Ordningen gjelder DeepSeek-V4-Flash og DeepSeek-V4-Pro. Toppperiodene er:
Alle andre tidspunkter regnes som lavtrafikk. Det er tidspunktet da DeepSeeks plattform mottar forespørselen som avgjør hvilken pris som brukes – ikke nødvendigvis når behandlingen er ferdig. 2
7
Det gir et enkelt forhold på 1:2: Den samme forespørselen koster dobbelt så mye dersom den sendes i en av toppperiodene.
Prisene under er oppgitt i kinesiske yuan per million tokens. Cache-hit betyr at en del av inndataene kan gjenbrukes fra en tidligere forespørsel. Ved cache-miss må inndataene behandles på nytt og prises høyere.
| Modell og token-type | Tidligere fast pris | Lavtrafikk | Endring | Topptrafikk | Endring |
|---|---|---|---|---|---|
| V4-Flash, inndata med cache-treff | ¥0,02 | ¥0,05 | +150 % | ¥0,10 | +400 % |
| V4-Flash, inndata uten cache-treff | ¥1,00 | ¥1,50 | +50 % | ¥3,00 | +200 % |
| V4-Flash, utdata | ¥2,00 | ¥4,50 | +125 % | ¥9,00 | +350 % |
| V4-Pro, inndata med cache-treff | ¥0,025 | ¥0,15 | +500 % | ¥0,30 | +1 100 % |
| V4-Pro, inndata uten cache-treff | ¥3,00 | ¥4,50 | +50 % | ¥9,00 | +200 % |
| V4-Pro, utdata | ¥6,00 | ¥13,50 | +125 % | ¥27,00 | +350 % |
For V4-Flash er lavtrafikkprisene altså ¥0,05, ¥1,50 og ¥4,50 for henholdsvis cache-treff på inndata, inndata uten cache-treff og utdata. I toppperiodene øker prisene til ¥0,10, ¥3 og ¥9. 2
Reuters oppsummerte den samlede prisøkningen til mellom 50 og 1 100 prosent, avhengig av modell, type tokens og tidspunkt. 1
Oppgaver som ikke trenger svar med én gang, kan legges til lavtrafikkperiodene. Det gjelder blant annet:
Siden lavtrafikk koster halvparten av topptrafikk, kan planlegging alene gi en merkbar kostnadsreduksjon. En kø som kjenner både tidsfristen og Beijing-tidens prisvinduer, kan utsette fleksible jobber uten å bytte modell eller kutte tokenbudsjettet. 2
Kundeservice, kodeassistenter og andre sanntidstjenester må vanligvis svare når brukeren er aktiv. De kan derfor ikke alltid unngå toppprisene.
Her blir andre tiltak viktigere: gjenbruk av instruksjoner, bedre cache-treff, kortere svar og automatisk ruting mellom modeller. For systemer som stadig sender de samme systeminstruksjonene, verktøybeskrivelsene eller dokumentutdragene, kan en høyere cache-treffrate være viktigere enn små reduksjoner i antall forespørsler.
Tunge resonneringsspor, omfattende rapporter og store kodeforslag bruker mange utdata-tokens. I toppperiodene koster disse ¥9 per million tokens med Flash og ¥27 med Pro.
Utviklere kan begrense kostnadene ved å sette strammere grenser for svarlengde, bruke Flash til rutineoppgaver og reservere Pro for oppgaver der den ekstra kapasiteten forsvarer merkostnaden. 1
2
V4-Pro har fått den kraftigste prosentvise økningen for cache-treff på inndata. Toppprisen på ¥0,30 per million tokens er tolv ganger den tidligere faste prisen på ¥0,025, tilsvarende en økning på 1 100 prosent. Beløpet er fortsatt lavt i absolutte yuan, men endringen blir betydelig for tjenester som behandler svært store mengder gjenbrukte forespørsler. 1
19
Prisendringen kom kort tid etter at DeepSeek-V4-Pro-0813 ble gjort allment tilgjengelig gjennom endepunktet deepseek-v4-pro i august. Rapporterte spesifikasjoner beskriver en tekstmodell med et kontekstvindu på én million tokens, maksimal utdata på 384 000 tokens og en mixture-of-experts-arkitektur med rundt 1,6 billioner parametere totalt og 49 milliarder aktive parametere per token. 29
33
DeepSeeks dokumenterte grenser for samtidige forespørsler skiller også modellene:
En forespørsel opptar en plass frem til hele svaret er ferdig, også når svaret strømmes fortløpende. 28
Prisene og kapasitetsgrensene peker mot en tydelig produktdeling: Flash passer bedre for rutineoppgaver med høyt volum, mens Pro er en mer begrenset og dyrere ressurs for krevende resonnering og store kontekster. Dette er en slutning basert på den publiserte prismodellen og kapasitetsgrensene – ikke en direkte beskrivelse av alle bruksområder. 2
28
Den nye modellen ligner etterspørselsstyring for GPU-beregning. Etterspørselen er gjerne størst når interaktive brukere er pålogget, mens mange batchjobber kan vente. Ved å prise kapasitet høyere i disse periodene og lavere ellers, forsøker leverandøren å spre belastningen utover døgnet.
For utviklere endrer dette optimaliseringsproblemet. Kostnadskontroll handler ikke lenger bare om modellvalg og antall tokens. Teamene må også vurdere:
Det bredere signalet er et skifte fra flatpriser og ren underprising til priser som i større grad følger knapphet på datakapasitet. DeepSeek tilbyr fortsatt en rimeligere kanal for fleksibel etterspørsel, men gjør kostnaden ved avansert inferens mer avhengig av når kapasiteten brukes. Reuters beskrev endringen som en betydelig prisøkning som varierer etter modell, tokentype og brukstid – ikke som ett ensartet pristillegg. 1
For virksomheter som bruker DeepSeek V4, er lærdommen praktisk: Planlegging, caching, modellruting og kontroll på svarlengden bør behandles som deler av selve API-kostnadsmodellen. Jobber som ikke kan flyttes i tid, kan kreve en annen modell eller et strammere tokenbudsjett. Jobber som kan vente, kan fortsatt beholde mye av kostnadseffektiviteten ved å kjøre utenfor toppperiodene.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek gikk over til tidsbasert prising for V4 Flash og V4 Pro klokken 00.00 Beijing tid 17.
DeepSeek gikk over til tidsbasert prising for V4 Flash og V4 Pro klokken 00.00 Beijing tid 17. Toppperiodene er 09.00–12.00 og 14.00–18.00 Beijing tid hver dag. En forespørsel prises etter når plattformen mottar den.
Ved høy belastning koster utdata 9 yuan per million tokens for V4 Flash og 27 yuan for V4 Pro.