DeepSeek V4 Flash může zůstat neobvykle levný pro dlouho běžící agenty: načtení z mezipaměti stojí 0,0028 USD za milion tokenů, zatímco cache miss 0,14 USD — rozdíl je padesátinásobný. Platformy třetích stran mohou uvádět nižší ceny, ale často nabízejí jiný snapshot modelu, kvantizaci, směrování, pravidla mezipaměti...
Research answer

Create a landscape editorial hero image for this Studio Global article: How can DeepSeek V4 Flash remain the cheapest major AI model—and potentially stay cheapest even after a 30× list-price increase—given that t. Article summary: DeepSeek V4 Flash can remain cheapest in effective cost because “price per input token” is the wrong unit for long-running agents. The decisive variable is the share of input that is served from a reusable prefix cache: . Topic tags: general, general web, user generated, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
Na první pohled se může zdát, že zdražení DeepSeek V4 Flash jeho hlavní cenovou výhodu zničí. Jenže srovnání cen za milion tokenů často přehlíží zásadní detail: vstup z mezipaměti a vstup bez zásahu mezipaměti se účtují velmi rozdílně. Podle dříve zveřejněného ceníku stál vstup při cache miss 0,14 USD za milion tokenů, cache hit 0,0028 USD a výstup 0,28 USD. 12
To je důležité především u kódovacích agentů, kteří v každém kroku znovu posílají stejné systémové instrukce, definice nástrojů, kontext repozitáře nebo dlouhé části předchozí konverzace. Neznamená to ale, že DeepSeek automaticky nabídne nejnižší účet každému uživateli a přes každou platformu.
Cena za token je pouze jedna část výsledného účtu. Pokud podíl vstupu načteného z mezipaměti označíme jako h, přibližná smíšená cena vstupu je:
h × sazba za cache hit + (1 − h) × sazba za cache miss
Při původních sazbách vyjde 99% podíl cache hitů přibližně na 0,00417 USD za milion tokenů. To je zhruba 34krát méně než 0,14 USD za cache miss. Výpočet nezahrnuje výstupní tokeny, které se účtují zvlášť a u úloh generujících dlouhé kusy kódu, vysvětlení nebo výsledky nástrojů mohou tvořit největší část nákladů.
Na stejném API tak mohou vzniknout velmi odlišné účty:
DeepSeek popisuje své API jako automatické cachování prefixu: opakované začátky promptů se účtují nižší sazbou pro cache hit. 12 Podmínkou je ale přesné opakování. Změna na začátku promptu může způsobit, že pozdější obsah už výhodu mezipaměti nevyužije.
Poskytovatelé třetích stran mohou uvádět nižší ceny než oficiální API. Například DeepInfra na své aktuální stránce uvádí u variant V4 Flash přibližně 0,08–0,09 USD za milion vstupních tokenů a 0,18 USD za milion výstupních tokenů, přičemž pro načtení z mezipaměti platí samostatné sazby. 29 OpenRouter zase nabízí několik poskytovatelů a snapshotů V4 Flash, jejichž ceny se liší podle verze a konkrétní trasy.
21
22
Nemusí přitom jít o zcela stejný produkt. Při smysluplném srovnání je potřeba ověřit zejména:
Nižší cena na ceníku tedy může být skutečně výhodnější u úloh s minimálním využitím mezipaměti. Naopak oficiální trasa může vyjít lépe u dlouhé relace, jejíž prefix zůstává beze změn. Správná otázka proto nezní „Kdo má nejnižší cenu vstupu?“, ale „Která trasa nejspolehlivěji dokončí úkol za nejnižší celkové náklady?“
Scénář s třicetinásobným zvýšením ceny je užitečný jako test citlivosti, nikoli jako předpověď. Pokud vynásobíme původní sazbu 0,0028 USD za cache hit třiceti, dostaneme 0,084 USD za milion tokenů. To je stále méně než původních 0,14 USD za cache miss.
Toto srovnání ale izoluje pouze jednu položku. Pokud by se třicetinásobně zvýšila také cena výstupu, původních 0,28 USD by vzrostlo na 8,40 USD za milion tokenů. Úloha s velkým množstvím generovaného obsahu by se tak mohla výrazně prodražit, i když by načítání z mezipaměti zůstalo relativně levné. Stejně tak by vyšší cenu vstupu přímo pocítil workflow s častými cache miss.
Závěr je proto podmíněný:
DeepSeek V4 Flash si může zachovat výhodu založenou na mezipaměti i po velmi výrazném nominálním zdražení. Nebude však nejlevnější pro každou kombinaci cache hitů, cache miss, výstupních tokenů a poplatků poskytovatele.
Pozdější zveřejněné ceníky zavedly sazby mimo špičku a ve špičce. U V4 Flash byla uváděna cena 0,22 USD za milion vstupních tokenů při cache miss, 0,007 USD při cache hit a 0,66 USD za výstup mimo špičku. Ve špičce se sazby zdvojnásobily na 0,44, 0,014 a 1,32 USD. 10
20
Jde o výrazné zvýšení proti dřívějším sazbám 0,14 / 0,0028 / 0,28 USD, nikoli však o jednotné třicetinásobné zdražení. Časově rozlišené ceny mohou přesouvat dávkové úlohy mimo vytížené období nebo omezovat poptávku v době nedostatku kapacity. Samy o sobě ale nedokazují, zda vzrostly náklady na provoz modelu, zda zůstala mimořádně vysoká poptávka, nebo zda hrály roli oba faktory.
Pro zákazníky je praktické poučení jednodušší: čas spuštění agenta se může stát součástí nákladového modelu. Pokud lze úlohy plánovat, vyplatí se porovnávat účty ve špičce a mimo špičku, nikoli spoléhat na jedinou nominální sazbu.
Komunitně zveřejněný experiment s 20 000 požadavky připsal DeepSeeku během dvanáctihodinového okna 100% podíl cache hitů. U GLM autor po pěti minutách uváděl výrazně nižší výsledek a ostatní modely se nacházely mezi těmito hodnotami. 31
Pozorování je zajímavé, protože ukazuje, proč mohou dlouho běžící agenti hodnotit poskytovatele jinak než krátké prompty. Nejde však o nezávisle zopakovaný benchmark napříč modely. Výsledek závisí na přesné konstrukci prefixu, vypuzování z mezipaměti, směrování, souběžnosti požadavků, době uchování i formátování promptu klientem.
Vývojáři by proto měli test zopakovat na vlastní trajektorii agenta a zvlášť zaznamenávat tokeny načtené z mezipaměti a tokeny bez zásahu mezipaměti. Stabilní architektura promptu — nejprve neměnné instrukce, proměnlivá data až později — může ekonomiku výrazně zlepšit. Výsledek je ale potřeba změřit, ne předpokládat.
OpenCode Go je jiný produkt než přímý přístup k API. Dokumentace uvádí předplatné za 10 USD měsíčně, které zahrnuje DeepSeek V4 Flash, a průběžné limity vyjádřené v dolarové hodnotě: 12 USD na pět hodin, 30 USD týdně a 60 USD měsíčně. 1
Předplatné nelze férově srovnávat s přímým API pouze podle měsíčního poplatku nebo sazby za token. OpenCode řídí směrování i výsledný limit využití, zatímco přímé API zpřístupňuje účtování po tokenech a chování mezipaměti. Zprávy o tarifu také uvádějí, že po zdražení se změnila hodnota využití přidělená modelu V4 Flash. 6
Tvrzení, že Go je při dlouhých relacích dvakrát až desetkrát dražší, by vyžadovalo spuštění stejného proudu promptů přes obě trasy a zaznamenání těchto údajů:
Bez takového kontrolovaného srovnání je bezpečnější závěr užší: předplatné může na papíře vypadat levněji, ale v praxi vést k vyšším efektivním nákladům, pokud jeho trasa ztrácí znovu použitelný kontext. Záleží na konkrétním workflow.
Pro realistické srovnání měřte cenu za dokončený úkol, nikoli pouze cenu za milion vstupních tokenů. U stejných snapshotů modelu a stejné sekvence promptů napříč poskytovateli zaznamenávejte:
Spusťte workflow přátelský k mezipaměti i workflow, který ji naopak často narušuje. První ukáže přínos stabilních prefixů, druhý odhalí, co se stane, když agent neustále přepisuje svůj kontext.
DeepSeek V4 Flash může zůstat jednou z nejlevnějších možností pro dlouho běžící kódovací agenty, protože prefixové cachování mění ekonomiku opakovaně posílaného kontextu. Třetí strana může nabídnout nižší cenu na ceníku a výrazné zdražení nemusí automaticky odstranit konkurenceschopnost cache hitů. Ani jedno však nedokazuje, že Flash je univerzálně nejlevnější.
Rozhodujícími proměnnými jsou podíl cache hitů, objem výstupu, ceny ve špičce, implementace poskytovatele a náklady na spolehlivé dokončení úkolu. U produkčních systémů mají tato měření větší vypovídací hodnotu než jediné srovnání ceníkových cen.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Flash může zůstat neobvykle levný pro dlouho běžící agenty: načtení z mezipaměti stojí 0,0028 USD za milion tokenů, zatímco cache miss 0,14 USD — rozdíl je padesátinásobný.
DeepSeek V4 Flash může zůstat neobvykle levný pro dlouho běžící agenty: načtení z mezipaměti stojí 0,0028 USD za milion tokenů, zatímco cache miss 0,14 USD — rozdíl je padesátinásobný. Platformy třetích stran mohou uvádět nižší ceny, ale často nabízejí jiný snapshot modelu, kvantizaci, směrování, pravidla mezipaměti nebo úroveň služeb.
Hypotetické třicetinásobné zdražení by podle původního ceníku zvýšilo cenu načtení z mezipaměti na 0,084 USD za milion tokenů — stále pod původní cenou 0,14 USD za cache miss.