| Model | Typ tokenu | Dřívější jednotná sazba | Mimo špičku (nová) | Ve špičce (nová) | Efektivní změna |
|---|---|---|---|---|---|
| V4-Flash | Vstup (cache miss) | 0,14 $ | 0,21 $ | 0,42 $ | +50 % mimo špičku, +200 % ve špičce |
| V4-Flash | Vstup (cache hit) | 0,0028 $ | 0,007 $ | 0,014 $ | +150 % mimo špičku, +400 % ve špičce |
| V4-Flash | Výstup | 0,28 $ | 0,42 $ | 0,84 $ | +50 % mimo špičku, +200 % ve špičce |
| V4-Pro | Vstup (cache miss) | 0,435 $ | 0,99 $ | 1,98 $ | +128 % mimo špičku, +355 % ve špičce |
| V4-Pro | Vstup (cache hit) | 0,003625 $ | 0,03 $ | 0,06 $ | +728 % mimo špičku, +1 555 % ve špičce |
| V4-Pro | Výstup | 0,87 $ | 1,98 $ | 3,96 $ | +128 % mimo špičku, +355 % ve špičce |
Nejextrémnější nárůst zaznamenal V4-Pro cache-hit vstup, který se z původních 0,003625 $ vyšplhal na 0,06 $ ve špičce – to je nárůst o zhruba 1 555 % . DeepSeek uvedl, že změna má za cíl efektivněji alokovat zdroje a motivovat uživatele k plánování méně naléhavých úloh mimo špičku
.
V srpnu 2026 nezávislá testovací firma Composio otestovala DeepSeek V4 Flash napříč osmi různými orchestračními nástroji (harness) na 30 záměrně obtížných, vícekrokových úlohách zahrnujících živé nástroje včetně Gmailu, GitHubu, Slacku a Google Sheets . Každá úloha měla časový limit 900 sekund a všechny nástroje používaly stejné hostované nástroje Composio MCP
.
Celkový výsledek: z 240 běhů jich uspělo jen 129 – celková úspěšnost 53,8 %. Pouze 6 z 30 úloh bylo úspěšně dokončeno všemi nástroji .
| Nástroj (Harness) | Úspěšnost (z 30 úloh) | Náklady na úspěšnou úlohu |
|---|---|---|
| Pi Agent | 20/30 (66,7 %) | 0,028 $ |
| Prime Agent | ~15/24 (62,5 % platných běhů) | 0,131 $ |
| OMP (Oh My Pi) | 17/30 (56,7 %) | 0,103 $ |
| Claude Code | 16/30 (53,3 %) | 0,195 $ |
| Codex | 16/30 (53,3 %) | 0,081 $ |
| Deep Agents (LangChain) | 16/30 (53,3 %) | 0,045 $ |
| Hermes Agent | 15/30 (50,0 %) | 0,056 $ |
| OpenCode | 14/30 (46,7 %) | 0,067 $ |
Pi Agent vedl jak v úspěšnosti (20/30), tak v nákladové efektivitě (0,028 $/úloha) . Jiný nástroj vyhrál v každé metrice – úspěšnosti, nákladech a rychlosti – což znamená, že volba orchestrace je stejně důležitá jako samotná schopnost modelu
. Dvacetibodový rozdíl mezi nejlepším a nejhorším nástrojem ukazuje na extrémní citlivost na agentní rámec, konfiguraci nástrojů, ukládání do mezipaměti, opakování a poskytovatele infrastruktury
.
Kombinace vyšších cen a nevyrovnaných výsledků v reálném světě vedla analytiky k přehodnocení vhodnosti DeepSeek V4 pro podniky.
Server VentureBeat poznamenal, že stejný model V4 Flash přinesl podstatně odlišné výsledky v závislosti na nástroji, konfiguraci nástrojů a mezipaměti – což naznačuje, že firmy musí investovat do vyspělosti orchestrace stejně jako do výběru modelu . Composio ve svém komentáři poukázal na to, že samotná volba nástroje změnila úspěšnost o tři úlohy, náklady téměř 3× a rychlost 2,2×
.
I mimo špičku je každý typ tokenu dražší než dříve. Analytici tvrdí, že to mění kalkulaci návratnosti investic pro objemné agentní úlohy, zejména pro zákaznickou podporu a pipeline pro generování kódu, které dříve spoléhaly na agresivně nízké ceny DeepSeek .
Oficiální agentní benchmarky DeepSeek (82,7 na Terminal-Bench 2.1, 70,3 na Toolathlon-Verified) vypadají skvěle, ale 53,8% úspěšnost v reálném světě je připomínkou, že výsledky v žebříčcích nezaručují spolehlivost v produkčním prostředí s živými API, rate limity a stavovými úlohami .
API provoz je směrován přes servery v Číně, což vytváří problémy s dodržováním předpisů pro regulované podniky. Analytici doporučují pečlivé architektonické plánování pro správu dat, auditní stopy a oprávnění nástrojů . Pro regulovaná odvětví zůstává jedinou životaschopnou cestou do produkce vlastní hostování otevřených vah
.