DeepSeek skiftede 17. august 2026 kl. Spidsbelastningen ligger dagligt kl.
Research answer

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
DeepSeek har ændret prisstrukturen for sine V4-API’er fra faste priser til timebaseret betaling. Ændringen trådte i kraft 17. august 2026 kl. 00.00 Beijing-tid, svarende til 16.00 UTC den 16. august. Priserne uden for spidsbelastningen er præcis halvdelen af priserne i spidsbelastningsperioden. Sammenlignet med de tidligere faste priser varierer stigningerne fra 50 % til 1.100 %, afhængigt af model, tokentype og tidspunkt. 1
2
Den nye prismodel gælder DeepSeek-V4-Flash og DeepSeek-V4-Pro.
Spidsbelastningsperioderne er:
Alle øvrige tidspunkter er lavprisperioder. En forespørgsel afregnes efter det tidspunkt, hvor DeepSeeks platform modtager den – ikke nødvendigvis efter hvornår behandlingen er færdig. Udviklere skal derfor tage højde for Beijing-tid, når de planlægger trafik og jobkøer. 2
7
Det er altså ikke blot en ensartet prisstigning. Den samme modelkaldelse koster dobbelt så meget i begge de daglige spidsbelastningsvinduer som uden for dem.
Alle beløb nedenfor er i kinesiske yuan pr. million tokens. Cache-hit betyder, at inputtet kan genbruge en tidligere gemt promptpræfiks. Ved cache-miss behandles inputtet som nyt og koster derfor mere.
| Model og tokentype | Tidligere fast pris | Lavpris | Ændring | Spidsbelastning | Ændring |
|---|---|---|---|---|---|
| V4-Flash, input med cache-hit | ¥0,02 | ¥0,05 | +150 % | ¥0,10 | +400 % |
| V4-Flash, input med cache-miss | ¥1,00 | ¥1,50 | +50 % | ¥3,00 | +200 % |
| V4-Flash, output | ¥2,00 | ¥4,50 | +125 % | ¥9,00 | +350 % |
| V4-Pro, input med cache-hit | ¥0,025 | ¥0,15 | +500 % | ¥0,30 | +1.100 % |
| V4-Pro, input med cache-miss | ¥3,00 | ¥4,50 | +50 % | ¥9,00 | +200 % |
| V4-Pro, output | ¥6,00 | ¥13,50 | +125 % | ¥27,00 | +350 % |
For V4-Flash er lavprisniveauerne dokumenteret til ¥0,05, ¥1,50 og ¥4,50 for henholdsvis cache-hit-input, cache-miss-input og output. I spidsbelastningen stiger de til ¥0,10, ¥3 og ¥9. 2 Reuters beskrev den samlede prisændring som en stigning på mellem 50 % og 1.100 % på tværs af modeller og tokentyper.
1
8
Ikke-akutte opgaver som evalueringer, dokumentindeksering, backfills, syntetisk datagenerering og andre købare jobs kan lægges uden for de to spidsbelastningsvinduer. Når lavprisniveauet er halvdelen af peak-prisen, kan planlægning alene gøre en mærkbar forskel for fleksible arbejdsbelastninger. 2
Tidspunktet bliver dermed en ny driftsvariabel i AI-infrastrukturen. En jobkø, der kender både deadline og Beijing-tidens prisvinduer, kan udskyde arbejdet uden at skifte model eller skære ned på tokenbudgettet.
Kundeservice, kodeassistenter og realtidsagenter kører typisk, når brugerne er aktive. De kan derfor være nødt til at acceptere peak-priser, men de kan stadig begrænse omkostningerne ved at genbruge prompts, designe forespørgsler cache-venligt, forkorte svar og route opgaver mellem modeller.
Caching er særligt vigtigt, fordi cache-hit-input fortsat er langt billigere end cache-miss-input på begge modeller. Systemer, der ofte sender de samme instruktioner, værktøjsdefinitioner eller dokumentuddrag, kan derfor få mere ud af at forbedre cache-hit-raten end af små reduktioner i antallet af forespørgsler.
Lange ræsonneringsspor, rapporter og store kodebesvarelser bruger mange outputtokens. I spidsbelastningen koster output ¥9 pr. million tokens for Flash og ¥27 for Pro. Udviklere kan svare igen ved at sætte strammere outputgrænser, bruge Flash til rutineopgaver og reservere Pro til situationer, hvor de ekstra egenskaber kan retfærdiggøre prisen. 1
2
V4-Pros peak-pris for cache-hit-input er 12 gange den tidligere faste pris – den største procentvise stigning i den nye model. Den absolutte pris er stadig lav sammenlignet med ukædet input og output, men ændringen kan få betydning for applikationer med meget store mængder gentagne, cachede prompts. 1
19
Prisændringen fulgte efter, at DeepSeek-V4-Pro-0813 blev gjort almindeligt tilgængelig via endpointet deepseek-v4-pro i august. De offentliggjorte specifikationer beskriver en tekstmodel med et kontekstvindue på én million tokens, en maksimal outputlængde på 384.000 tokens og en mixture-of-experts-arkitektur med cirka 1,6 billioner samlede parametre og 49 milliarder aktive parametre pr. token. 29
33
De dokumenterede samtidighedsgrænser adskiller samtidig de to niveauer:
En forespørgsel optager en plads, indtil hele svaret er færdigt – også ved streamede svar. 28
Prisstrukturen og samtidighedsgrænserne peger samlet på en produktdeling, hvor Flash er bedre egnet til rutinetrafik med høj gennemstrømning, mens Pro er et mere kapacitetsbegrænset niveau til krævende ræsonnering og opgaver med meget stor kontekst. Det er en slutning baseret på de offentliggjorte priser og grænser, ikke en direkte beskrivelse af alle anvendelser. 2
28
DeepSeeks ændring minder om efterspørgselsstyring for GPU-baseret inferens. Udbydere møder ofte den største efterspørgsel, når interaktive brugere er online, mens batchjob i mange tilfælde kan vente. Højere priser i disse perioder og lavere priser på andre tidspunkter giver et økonomisk incitament til at sprede beregningerne over døgnet.
For udviklere ændrer det optimeringsopgaven. Det handler ikke længere kun om at vælge model og tælle tokens. Produktionsteams skal også tage stilling til:
Den bredere tendens er et skifte væk fra flade priser og mod betaling efter kapacitetsknaphed. DeepSeek tilbyder stadig en billigere kanal til fleksibel efterspørgsel, men gør samtidig prisen på avanceret inferens mere afhængig af, hvornår kapaciteten bruges. Reuters beskrev ændringen som en betydelig prisstigning, der varierer efter model, tokentype og brugstidspunkt – ikke som ét ensartet tillæg for alle kunder. 1
For teams, der bruger DeepSeek V4, er den praktiske konklusion enkel: Planlægning, caching, modelrouting og kontrol af outputlængden bør behandles som dele af den samme API-økonomi. Arbejdsbelastninger, der ikke kan flyttes i tid, kan kræve en anden model eller et strammere tokenbudget. Opgaver, der godt kan vente, kan derimod stadig bevare en stor del af deres økonomi ved at køre uden for spidsbelastningen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek skiftede 17. august 2026 kl.
DeepSeek skiftede 17. august 2026 kl. Spidsbelastningen ligger dagligt kl. 09.00–12.00 og 14.00–18.00 Beijing tid.
Jobkøer, prompt caching, kortere svar og routing mellem Flash og Pro bliver nu centrale værktøjer til at holde API regningen nede.