| Model | Tokentype | Tidligere fast pris | Lavtrafik (ny) | Spidsbelastning (ny) | Ændring |
|---|---|---|---|---|---|
| V4-Flash | Input (cache miss) | 0,14 $ | 0,21 $ | 0,42 $ | +50 % lavtrafik, +200 % spids |
| V4-Flash | Input (cache hit) | 0,0028 $ | 0,007 $ | 0,014 $ | +150 % lavtrafik, +400 % spids |
| V4-Flash | Output | 0,28 $ | 0,42 $ | 0,84 $ | +50 % lavtrafik, +200 % spids |
| V4-Pro | Input (cache miss) | 0,435 $ | 0,99 $ | 1,98 $ | +128 % lavtrafik, +355 % spids |
| V4-Pro | Input (cache hit) | 0,003625 $ | 0,03 $ | 0,06 $ | +728 % lavtrafik, +1.555 % spids |
| V4-Pro | Output | 0,87 $ | 1,98 $ | 3,96 $ | +128 % lavtrafik, +355 % spids |
Den mest ekstreme stigning er for V4-Pro cache-hit input, som gik fra 0,003625 $ til 0,06 $ i spidsbelastningsperioden – en stigning på cirka 1.555 % . DeepSeek oplyste, at ændringen blev foretaget for at allokere ressourcer mere effektivt og opfordre brugerne til at planlægge ikke-hasterbejde i lavtrafikperioderne
.
I august 2026 evaluerede det uafhængige testfirma Composio DeepSeek V4 Flash på tværs af otte forskellige agent-orkestreringsrammeværker med 30 bevidst vanskelige, flertrinsarbejdsgange, der spændte over liveværktøjer som Gmail, GitHub, Slack og Google Sheets . Hver opgave havde en timeout på 900 sekunder, og alle rammeværker brugte de samme hosted Composio MCP-værktøjer
.
Det samlede resultat: På tværs af 240 kørsler lykkedes det kun 129 – en samlet succesrate på 53,8 %. Kun 6 af de 30 arbejdsgange blev gennemført med succes af alle rammeværker .
| Rammeværk | Succesrate (ud af 30 opgaver) | Omkostning pr. succesfuld opgave |
|---|---|---|
| Pi Agent | 20/30 (66,7 %) | 0,028 $ |
| Prime Agent | ~15/24 (62,5 % gyldige kørsler) | 0,131 $ |
| OMP (Oh My Pi) | 17/30 (56,7 %) | 0,103 $ |
| Claude Code | 16/30 (53,3 %) | 0,195 $ |
| Codex | 16/30 (53,3 %) | 0,081 $ |
| Deep Agents (LangChain) | 16/30 (53,3 %) | 0,045 $ |
| Hermes Agent | 15/30 (50,0 %) | 0,056 $ |
| OpenCode | 14/30 (46,7 %) | 0,067 $ |
Pi Agent førte både i succesrate (20/30) og omkostningseffektivitet (0,028 $/opgave) . Forskellige rammeværker vandt på hver sin parameter – succesrate, omkostning og hastighed – hvilket betyder, at valget af orkestreringsværktøj er lige så vigtigt som modelkapaciteten
. Forskellen på 20 procentpoint mellem det bedste og det dårligste rammeværk viser en ekstrem følsomhed over for agentrammeværket, værktøjskonfiguration, caching, genforsøg og udbyderstack
.
Kombinationen af højere priser og ujævne resultater i praksis har fået analytikere til at revurdere DeepSeek V4's egnethed til virksomheder.
VentureBeat påpegede, at den samme V4 Flash-model gav væsentligt forskellige resultater afhængigt af rammeværket, værktøjskonfigurationen og caching-stacken – hvilket tyder på, at virksomheder skal investere i orkestreringsmodenhed sideløbende med modelvalg . Composio selv bemærkede, at valget af rammeværk alene ændrede succesraten med tre opgaver, omkostningen med næsten 3x og hastigheden med 2,2x
.
Selv i lavtrafik er hver tokentype dyrere end før. Analytikere siger, at dette ændrer ROI-beregningen for agent-arbejdsbelastninger med stort volumen, især for kundeserviceagenter og kodegenereringspipelines, der tidligere var afhængige af DeepSeeks aggressive lave priser .
DeepSeeks officielle agentbenchmarks (82,7 på Terminal-Bench 2.1, 70,3 på Toolathlon-Verified) ser stærke ud, men succesraten på 53,8 % i praksis er en påmindelse om, at leaderboard-score ikke garanterer pålidelighed i produktionsmiljøer med live API'er, hastighedsbegrænsninger og tilstandsafhængige arbejdsgange .
API-trafik rutes gennem servere i Kina, hvilket skaber compliance-udfordringer for regulerede virksomheder. Analytikere anbefaler omhyggelig arkitektonisk planlægning med hensyn til datastyring, revisionsspor og værktøjstilladelseskontrol . For regulerede industrier er selv-hostning af de åbne vægte fortsat den eneste levedygtige vej til produktion
.