| Model | Tokentype | Eerdere vaste prijs | Dal (nieuw) | Piek (nieuw) | Effectieve verandering |
|---|---|---|---|---|---|
| V4-Flash | Invoer (cache misser) | $0,14 | $0,21 | $0,42 | +50% dal, +200% piek |
| V4-Flash | Invoer (cacher). | $0,0028 | $0,007 | $0,014 | +150% dal, +400% piek |
| V4-Flash | Uitvoer | $0,28 | $0,42 | $0,84 | +50% dal, +200% piek |
| V4-Pro | Invoer (cache misser) | $0,435 | $0,99 | $1,98 | +128% dal, +355% piek |
| V4-Pro | Invoer (cacher) | $0,003625 | $0,03 | $0,06 | +728% dal, +1.555% piek |
| V4-Pro | Uitvoer | $0,87 | $1,98 | $3,96 | +128% dal, +355% piek |
De grootste stijging is bij V4-Pro cache-hit invoer: van $0,003625 naar $0,06 tijdens piek — een toename van ruwweg 1.555% . DeepSeek zelf verklaarde de wijziging als een manier om middelen efficiënter te alloceren en gebruikers aan te moedigen niet-spoedeisende taken tijdens daluren te plannen
.
In augustus 2026 evalueerde het onafhankelijke testbureau Composio DeepSeek V4 Flash in acht verschillende agentorkestratieomgevingen (harnesses) op dertig bewust moeilijke, meerstaps workflows met live tools zoals Gmail, GitHub, Slack en Google Sheets . Elke taak kreeg een timeout van 900 seconden; alle harnesses gebruikten dezelfde gehoste Composio MCP-tools
.
Het algemene resultaat: van in totaal 240 runs slaagden er slechts 129 — een slagingspercentage van 53,8%. Slechts 6 van de 30 workflows werden door elke harness succesvol voltooid .
| Harness | Slagingskans (van 30 taken) | Kosten per succesvolle taak |
|---|---|---|
| Pi Agent | 20/30 (66,7%) | $0,028 |
| Prime Agent | ~15/24 (62,5% geldige runs) | $0,131 |
| OMP (Oh My Pi) | 17/30 (56,7%) | $0,103 |
| Claude Code | 16/30 (53,3%) | $0,195 |
| Codex | 16/30 (53,3%) | $0,081 |
| Deep Agents (LangChain) | 16/30 (53,3%) | $0,045 |
| Hermes Agent | 15/30 (50,0%) | $0,056 |
| OpenCode | 14/30 (46,7%) | $0,067 |
Pi Agent scoorde het hoogste qua slagingskans (20/30) en kostenefficiëntie ($0,028/taak) . Op elke meetwaarde — slagingskans, kosten en snelheid — won een andere harness, wat betekent dat de keuze van orkestratie minstens zo belangrijk is als de modelcapaciteit
. Het verschil van twintig procentpunt tussen de beste en slechtste harness toont extreme gevoeligheid voor het agentraamwerk, toolconfiguratie, caching, retries en de providerstack
.
De combinatie van hogere prijzen en wisselende praktijkprestaties heeft de kijk van analisten op de geschiktheid van DeepSeek V4 voor bedrijven veranderd.
VentureBeat merkte op dat hetzelfde V4 Flash-model sterk uiteenlopende resultaten liet zien, afhankelijk van de harness, tooling en caching-stack. Dit wijst erop dat bedrijven moeten investeren in orkestratiematuriteit naast modelselectie . Composio zelf wees erop dat de keuze van de harness alleen al het succes met drie taken veranderde, de kosten bijna verdrievoudigde en de snelheid met een factor 2,2 beïnvloedde
.
Zelfs tijdens daluren is elk tokentype duurder dan voorheen. Analisten stellen dat dit de ROI-berekening voor hoogvolume agentische workloads verandert, vooral voor klantenservicebots en codegeneratiepijplijnen die eerder profiteerden van DeepSeeks agressief lage prijzen .
DeepSeek's officiële agentbenchmarks (82,7 op Terminal-Bench 2.1, 70,3 op Toolathlon-Verified) zien er indrukwekkend uit, maar het reële slagingspercentage van 53,8% herinnert eraan dat leaderboardscores geen garantie bieden voor betrouwbaarheid in productieomgevingen met live API's, snelheidslimieten en stateful workflows .
API-verkeer loopt via servers in China, wat nalevingsuitdagingen oplevert voor gereguleerde bedrijven . Analisten adviseren zorgvuldige architectuurplanning voor databeheer, audittrails en machtigingscontroles voor tools
. Voor gereguleerde sectoren blijft self-hosting van de open gewichten de enige haalbare weg naar productie
.