DeepSeek schakelde V4 Flash en V4 Pro op 17 augustus 2026 om 00.00 uur Beijing tijd over op tijdsgebonden tarieven. De piekuren vallen dagelijks tussen 09.00 en 12.00 uur en tussen 14.00 en 18.00 uur Beijing tijd.
Research answer

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
DeepSeek heeft de prijsstructuur voor zijn V4-API aangepast. Sinds 17 augustus 2026 om 00.00 uur Beijing-tijd — 16 augustus om 16.00 uur UTC — gelden voor DeepSeek-V4-Flash en DeepSeek-V4-Pro afzonderlijke piek- en daltarieven. In de daluren betalen gebruikers precies de helft van het piektarief. 1
2
Dat is meer dan een gewone prijsverhoging. Het moment waarop een verzoek bij de servers aankomt, bepaalt voortaan mede de rekening. Voor ontwikkelaars betekent dit dat niet alleen het model en het aantal tokens tellen, maar ook de klok.
DeepSeek rekent dagelijks piektarieven tijdens:
Alle overige uren gelden als daluren. De facturatie wordt bepaald door het tijdstip waarop het platformverzoek door de server wordt ontvangen. De duur van de verwerking verandert dat tarief niet. 2
7
Voor gebruikers in Nederland en België komt dat doorgaans neer op zeven uur vroeger tijdens de wintertijd en zes uur vroeger tijdens de zomertijd. De exacte lokale tijd hangt dus af van de Europese zomertijd en van de datum.
De bedragen hieronder zijn in Chinese yuan per miljoen tokens. Een cache-hit betekent dat een eerder gebruikte prompt of promptprefix opnieuw kan worden benut. Bij een cache-miss moet de invoer volledig opnieuw worden verwerkt en geldt het hogere invoertarief.
| Model en type tokens | Oud vast tarief | Daluren | Verschil | Piekuren | Verschil |
|---|---|---|---|---|---|
| V4-Flash, invoer met cache-hit | ¥0,02 | ¥0,05 | +150% | ¥0,10 | +400% |
| V4-Flash, invoer met cache-miss | ¥1,00 | ¥1,50 | +50% | ¥3,00 | +200% |
| V4-Flash, output | ¥2,00 | ¥4,50 | +125% | ¥9,00 | +350% |
| V4-Pro, invoer met cache-hit | ¥0,025 | ¥0,15 | +500% | ¥0,30 | +1.100% |
| V4-Pro, invoer met cache-miss | ¥3,00 | ¥4,50 | +50% | ¥9,00 | +200% |
| V4-Pro, output | ¥6,00 | ¥13,50 | +125% | ¥27,00 | +350% |
De officiële Flash-tarieven zijn ¥0,05, ¥1,50 en ¥4,50 per miljoen tokens in de daluren voor respectievelijk cache-hit-invoer, cache-miss-invoer en output. Tijdens piekuren stijgen die bedragen naar ¥0,10, ¥3 en ¥9. 2 Volgens Reuters lopen de verhogingen voor de verschillende modellen en tokencategorieën uiteen van 50% tot 1.100%.
1
8
Niet-dringend werk kan vaak worden uitgesteld. Denk aan evaluaties, het indexeren van documenten, backfills, het genereren van synthetische data en andere taken die niet direct een gebruiker hoeven te bedienen. Door zulke opdrachten buiten de twee piekvensters te plannen, kan de API-rekening halveren ten opzichte van uitvoering tijdens piekuren. 2
Een wachtrij die rekening houdt met zowel de deadline als de Beijing-tijdse facturatieperiode, kan dat werk automatisch doorschuiven. Daarvoor hoeft het model of het tokenbudget niet te veranderen.
Klantenservice, programmeerassistenten en realtime-agents werken meestal op het moment dat gebruikers actief zijn. Zij kunnen de piekuren dus moeilijk vermijden. Wel kunnen ontwikkelaars de kosten beperken door prompts vaker te hergebruiken, de cache-hit-ratio te verhogen, antwoorden korter te maken en verzoeken naar het juiste model te sturen.
Caching is daarbij opvallend belangrijk. In beide modellen blijft invoer met een cache-hit veel goedkoper dan invoer zonder cache-hit. Systemen die steeds dezelfde instructies, tooldefinities of documentcontext meesturen, kunnen daarom meer besparen door hun promptontwerp te verbeteren dan door alleen het aantal verzoeken te verlagen.
Toepassingen die veel output genereren — zoals uitgebreide redeneerprocessen, rapporten en grote codeblokken — krijgen te maken met hogere totale kosten. Tijdens piekuren kost een miljoen outputtokens ¥9 bij Flash en ¥27 bij Pro.
Praktische maatregelen zijn onder meer:
Het piektarief voor cache-hit-invoer bij V4-Pro ligt twaalf keer zo hoog als het oude vaste tarief. Dat is de grootste procentuele stijging in het nieuwe schema. In absolute yuan blijft het bedrag laag vergeleken met cache-miss-invoer en output, maar voor toepassingen met enorme volumes aan herhaalde prompts kan het verschil toch relevant worden. 1
19
De prijswijziging volgde op de algemene beschikbaarheid van DeepSeek-V4-Pro-0813, die in augustus beschikbaar kwam achter het endpoint deepseek-v4-pro. Volgens de gerapporteerde specificaties heeft het tekstmodel een contextvenster van één miljoen tokens, een maximale output van 384.000 tokens en een mixture-of-expertsarchitectuur met ongeveer 1,6 biljoen totale parameters, waarvan circa 49 miljard parameters per token actief zijn. 29
33
De gedocumenteerde limieten voor gelijktijdige verzoeken verschillen per model:
Een verzoek bezet een plaats tot de volledige respons is afgerond, ook wanneer die respons gestreamd wordt. 28
Samen met de prijsstructuur wijst dit op een duidelijke productverdeling: Flash is beter geschikt voor routinematig verkeer met een hoge doorvoer, terwijl Pro meer gericht lijkt op zware redeneertaken en toepassingen met grote contextvensters. Dat is een gevolgtrekking uit de gepubliceerde prijzen en limieten, geen expliciete uitspraak over iedere mogelijke toepassing. 2
28
De overstap lijkt op vraagsturing voor GPU-inferentie. De vraag naar rekenkracht concentreert zich vooral op momenten waarop interactieve gebruikers online zijn. Batchtaken kunnen vaak wachten. Door capaciteit tijdens drukke uren duurder te maken en flexibele vraag op andere momenten goedkoper te bedienen, probeert een aanbieder de belasting over de dag te spreiden.
Voor ontwikkelteams verandert daarmee de kostenberekening. De belangrijkste vragen zijn nu:
De bredere ontwikkeling wijst op een verschuiving weg van een eenvoudige prijsstrijd met één laag tarief. In plaats daarvan worden prijzen gekoppeld aan schaarste in reken- en servercapaciteit. DeepSeek houdt een goedkopere route beschikbaar voor flexibele vraag, maar maakt hoogwaardige inferentie gevoeliger voor het tijdstip waarop die capaciteit wordt gebruikt. Reuters omschreef de wijziging als een aanzienlijke verhoging die varieert per model, tokencategorie en gebruiksperiode — niet als één uniforme toeslag. 1
Voor teams die DeepSeek V4 gebruiken is de praktische conclusie helder: behandel planning, caching, routing en outputlimieten als onderdelen van hetzelfde API-kostenmodel. Werk dat niet kan wachten, vraagt mogelijk om een ander model of een kleiner tokenbudget. Werk dat wel kan wachten, kan een groot deel van de kostenbesparing behouden door buiten de piekuren te draaien.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek schakelde V4 Flash en V4 Pro op 17 augustus 2026 om 00.00 uur Beijing tijd over op tijdsgebonden tarieven.
DeepSeek schakelde V4 Flash en V4 Pro op 17 augustus 2026 om 00.00 uur Beijing tijd over op tijdsgebonden tarieven. De piekuren vallen dagelijks tussen 09.00 en 12.00 uur en tussen 14.00 en 18.00 uur Beijing tijd.
Caching, modelkeuze en het plannen van batchtaken zijn nu rechtstreeks met elkaar verbonden in het kostenmodel van de API.