DeepSeek V4 Flash se v týdenním žebříčku OpenRouteru za 27. července až 2. Model nabízí až 1 310 720 tokenů kontextu a OpenRouter u datované verze uvádí cenu 0,05 USD za milion vstupních a 0,16 USD za milion výstupních tokenů.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek V4-Flash, launched in public API beta on July 31, 2026, become OpenRouter’s most-used model within four days—reaching 7.1 t. Article summary: The reported surge is best explained by an unusually strong cost–capability–context combination, amplified by OpenRouter’s low-friction routing and likely substantial trial traffic—not by architecture alone. But several . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-0731 ukázal, jak rychle se mohou změnit výchozí volby vývojářů, když se v jeden okamžik spojí nízká cena tokenů, velké kontextové okno a jednoduchý přístup přes agregátor. V týdenním žebříčku využití OpenRouteru za období 27. července až 2. srpna obsadil první místo se 7,22 bilionu zpracovaných tokenů. Tento výsledek je skutečný, je ale třeba ho číst opatrně. 5
Verze z 31. července je řídký model typu mixture-of-experts (MoE): má 284 miliard parametrů celkem, ale při zpracování jednoho tokenu aktivuje 13 miliard parametrů. OpenRouter jej uvádí pro programování, reasoning a agentní workflow; kontextové okno činí 1 310 720 tokenů. 1
Tato kombinace je atraktivní zejména tam, kde rozhoduje objem zpracovaného textu:
Samotná architektura MoE ovšem nedokazuje nižší skutečné náklady ani vyšší kvalitu. Její ekonomický smysl spočívá v tom, že aktivace jen části parametrů na token má nabídnout velkou modelovou kapacitu bez výpočetního profilu hustého modelu stejné celkové velikosti. Zda se to projeví v konkrétní aplikaci, závisí i na latenci, kapacitě poskytovatele, routování, podobě promptů a délce odpovědí.
TechNode uvedl, že DeepSeek V4 Flash na OpenRouteru za týden od 27. července do 2. srpna zpracoval 7,22 bilionu tokenů. Podle téhož reportu obsadily čínské modely první čtyři příčky a DeepSeek V4 Flash 0731 spolu s V4 Pro byly v první šestce. 5
Sledovaný týden však začal ještě před veřejným beta vydáním z 31. července. V4 Flash už předtím existoval jako preview route a vydání 0731 tento náhled nahradilo na API endpointu deepseek-v4-flash. 3 Týdenní součet proto nelze popisovat jako provoz vytvořený výhradně novou verzí.
Dalším významným zkreslením je bezplatný přístup. Tentýž report uvádí, že OpenCode zpracoval pro tento model 1. srpna 8 bilionů tokenů: 5 bilionů v bezplatných zkouškách a 3 biliony placené vývojáři. 5 Zkušební provoz může být strategicky důležitý, protože snižuje překážky při testování modelu. Není ale totéž co dlouhodobá placená produkční poptávka.
Přesnější závěr tedy zní: V4-Flash získal mimořádně rychlou distribuci a zájem o experimentování. Dostupné podklady však nedokazují, že celý počáteční objem představoval placené migrace či dlouhodobé nasazení v produkci.
Ceny se liší podle poskytovatele, routy, slevy, stavu cache i data měření. U oficiální ceny citované v souvislosti s vydáním z 31. července šlo o 0,14 USD za milion necachovaných vstupních tokenů a 0,28 USD za milion výstupních tokenů; OpenRouter tehdy uváděl jiné sazby podle konkrétní routy. 3
Pozdější výpis OpenRouteru pro datovanou routu deepseek-v4-flash-0731 uvádí 0,05 USD za milion vstupních tokenů, 0,16 USD za milion výstupních tokenů a 0,013 USD za milion tokenů načtených z cache. 1
Při použití těchto sazeb OpenRouteru je rozdíl proti dodanému srovnání výrazný:
| Model | Uvedená cena vstup / výstup za 1 mil. tokenů | Ve srovnání s V4-Flash za 0,05 / 0,16 USD |
|---|---|---|
| DeepSeek V4-Flash-0731 | 0,05 / 0,16 USD |
Základ |
| Kimi K3 | 3 / 15 USD |
Přibližně 60× / 94× více |
| GPT-5.6 Sol | 5 / 30 USD |
Přibližně 100× / 188× více |
| Claude Fable 5 | 10 / 50 USD |
Přibližně 200× / 313× více |
Jde o aritmetické porovnání publikovaných ceníkových cen, nikoli o důkaz srovnatelné kvality, rychlosti, spolehlivosti nástrojů, bezpečnostního chování či dostupnosti. Neříká ani nic univerzálního o „ceně za úkol“. Tu určují délka vstupů a výstupů, cache, opakované pokusy, volání nástrojů, zvolený poskytovatel i to, jak často workflow předává úlohu jinému modelu.
Kimi K3, GPT-5.6 Sol a Claude Fable 5 nelze považovat za stejné produkty jen proto, že všechny míří i na pokročilé programování a agentní použití. Dodaný srovnávací zdroj popisuje Kimi K3 jako MoE model s 2,8 bilionu parametrů a kontextem 1 milion tokenů; u GPT-5.6 Sol uvádí kontext 1,05 milionu tokenů a u Claude Fable 5 1 milion tokenů. 17
Pro kupujícího je praktičtější rozlišovat podle provozních potřeb:
Veřejné benchmarky pomáhají sestavit užší výběr, jeden výsledek ale neurčuje produkční výchozí model. Konkrétní srovnání 25,2 versus 25,7 v benchmarku „Agent Ultimate“ nebylo z dodaných primárně laděných zdrojů nezávisle doloženo, a nemělo by proto sloužit jako důkaz téměř stejné kvality. Materiál k vydání DeepSeeku uvádí například 82,7 v Terminal Bench 2.1 a 54,2 v NL2Repo, i tyto výsledky však vyžadují ověření na konkrétním workloadu. 10
Pro středně velký vývojový tým se obvykle nerozhoduje otázkou „Který model vyhrál leaderboard?“. Podstatnější je: Je model na našem reálném workloadu dost spolehlivý, aby úspora po započtení chyb a routování dávala smysl?
Praktická evaluace může vypadat následovně:
Proto je vzestup V4-Flash důležitý i v případě, že úvodní čísla navýšily zkušební přístupy. Ukazuje, jak agregátor s nízkou vstupní bariérou umožní vývojářům okamžitě vyzkoušet velmi levný model s dlouhým kontextem. Pokud v produkčních evaluacích obstojí, může převzít rutinní objem práce od dražších výchozích modelů.
Dostupné podklady podporují tvrzení o týdenním prvenství se 7,22 bilionu tokenů na OpenRouteru, překryvu s dřívějším preview obdobím i uváděné bezplatné zkušební složce provozu na OpenCode. 3
5 Nedokládají ale dostatečně tvrzení, že čínské modely obsadily devět z deseti prvních míst, že 14 týdnů v řadě překonávaly objem volání z USA, že nastala plošná migrace amerických a evropských vývojářů, že firmy reálně snížily náklady na inferenci o 60 až 85 % nebo že GPT-5.6 Luna kvůli tomu zlevnil o konkrétních 80 %.
Taková tvrzení by vyžadovala přímá data z dashboardu OpenRouteru, ceníky poskytovatelů nebo reprodukovatelné studie konkrétních workloadů. Závěr podložený dostupnými zdroji je užší: DeepSeek V4-Flash spojil mimořádně nízké ceny na vybraných routách, velké kontextové okno a širokou dostupnost právě ve chvíli, kdy vývojáři hledali levnější modely pro agenty a programování. To stačí k rychlému nárůstu využití, samo o sobě to ale nedokazuje trvalé přeskupení trhu.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4 Flash se v týdenním žebříčku OpenRouteru za 27. července až 2.
DeepSeek V4 Flash se v týdenním žebříčku OpenRouteru za 27. července až 2. Model nabízí až 1 310 720 tokenů kontextu a OpenRouter u datované verze uvádí cenu 0,05 USD za milion vstupních a 0,16 USD za milion výstupních tokenů.
Rané objemy nejsou totéž co stabilní placená produkční poptávka: u OpenCode bylo 5 z 8 bilionů tokenů z 1.