Ve stejnou dobu čínská společnost začala nabírat open-source vývojáře do uzavřeného beta testu DeepSeek Harness – frameworku, který má jazykovým modelům umožnit samostatně plánovat úkoly, pracovat s kontextem a používat nástroje .
V4 Flash je úspornější varianta rodiny DeepSeek V4, určená především pro rychlé a objemné nasazení: například chat, klasifikaci, extrakci informací, generování kódu nebo provoz AI agentů.
Model využívá architekturu Mixture of Experts (MoE). Celkem obsahuje 284 miliard parametrů, ale při zpracování konkrétního tokenu se aktivuje přibližně 13 miliard. Model tak může čerpat ze široké sady specializovaných „expertů“, aniž by při každém kroku počítal se všemi parametry .
| Vlastnost | Hodnota |
|---|---|
| Celkový počet parametrů | 284 miliard |
| Parametry aktivní na token | 13 miliard |
| Architektura | Mixture of Experts (MoE) |
| Kontextové okno | 1 000 000 tokenů |
| Maximální délka výstupu | 384 000 tokenů |
| Přesnost | kombinace FP4 a FP8 |
| Licence | MIT |
| Velikost stažení | přibližně 160 GB |
Pokud se započítá také připojený modul DSpark pro spekulativní dekódování, uvádí některé materiály celkem 304 miliard parametrů v repozitáři .
V4 Flash i větší V4 Pro jsou dostupné s otevřenými vahami pod permisivní licencí MIT. Ta obecně umožňuje komerční použití, úpravy i další distribuci bez licenčních poplatků . Váhy lze stáhnout z platforem, jako je Hugging Face, a provozovat je na vlastní infrastruktuře.
To je důležitý rozdíl oproti modelům dostupným výhradně přes uzavřené API. Firmy mohou model integrovat do vlastních produktů, přizpůsobit si ho nebo ho provozovat v privátním prostředí. Otevřená licence ale sama o sobě neznamená, že je lokální provoz levný: plná velikost modelu stále představuje značné nároky na hardware.
Jedním z hlavních technických prvků V4 Flash je hybridní mechanismus pozornosti, který kombinuje dvě metody komprese dlouhého kontextu:
Vrstvy CSA a HCA se střídají. Od druhé vrstvy používají sudé vrstvy CSA, zatímco od třetí vrstvy se na lichých vrstvách uplatňuje HCA. Součástí architektury je také posuvné okno posledních 128 neupravených tokenů, které pomáhá zachovat informace z bezprostředního okolí .
Praktickým výsledkem je možnost pracovat s kontextem až 1 milionu tokenů – tedy s množstvím textu, které může zahrnovat rozsáhlou dokumentaci, celý softwarový projekt nebo dlouhou historii interakcí.
V4 Flash používá smíšenou přesnost, aby omezil nároky na paměť a přenos dat:
nvidia/DeepSeek-V4-Flash-NVFP4 .Samotné váhy ve formátu FP8 by zabraly přibližně 284 GB. Pro provoz s plným milionovým kontextem uvádějí dostupné odhady konfiguraci čtyř akcelerátorů NVIDIA H200 SXM5 s celkovou kapacitou 564 GB VRAM . To znamená, že model je otevřený, ale jeho plnohodnotný lokální provoz zůstává především záležitostí datových center nebo specializovaných GPU cloudů.
Vývojáři mohou pomocí parametru reasoning_effort nastavit, kolik výpočetního úsilí má model věnovat odpovědi. Dostupné jsou tři režimy:
Toto nastavení umožňuje měnit kompromis mezi rychlostí, cenou a hloubkou odpovědi. Pro jednoduché třídění dat tak není nutné používat stejný režim jako pro vícefázové programování nebo práci AI agenta s nástroji.
Oficiální ceny DeepSeek V4 Flash jsou uvedeny za 1 milion tokenů:
U opakovaných systémových instrukcí nebo stejných prefixů tak může cena vstupu klesnout o 98 procent . Výstupní tokeny jsou přitom u agentních a programátorských úloh často významnou částí celkových nákladů.
Podle srovnání uváděných v dostupných zdrojích je výstup V4 Flash přibližně 54krát levnější než u Sonnetu 4.6 s cenou 15 dolarů za milion tokenů a 107krát levnější než u GPT-5.5 s cenou 30 dolarů za milion tokenů . Několik analýz proto model označuje za jednu z nejlevnějších API služeb ve frontierové kategorii .
Produkční vydání V4-Flash-0731 nepřineslo novou architekturu ani větší model. Podle dostupných informací se zlepšení opírají především o další fázi tréninku po původním vydání .
Oficiální aktualizace uvádí tyto výsledky:
DeepSeek uvádí, že produkční Flash dosahuje na agentních a programátorských testech srovnatelné úrovně jako větší V4 Pro . To narušuje běžné očekávání, že varianta „Flash“ musí být v těchto úlohách výrazně slabší než varianta „Pro“ .
Přesné skóre SWE-bench pro V4-Flash-0731 se v přezkoumávaných zdrojích nepodařilo nezávisle potvrdit. U tohoto benchmarku je proto namístě vyhnout se pevným číslům převzatým z méně ověřených přehledů .
DeepSeek současně rozšiřuje záběr od samotných jazykových modelů k takzvané agentní infrastruktuře. DeepSeek Harness má fungovat jako prováděcí framework, který běží mimo samotný model a stará se například o:
Název Harness se poprvé objevil v aktualizaci k V4-Flash-0731 s poznámkou, že bude vydán později . Dne 1. srpna 2026 začal DeepSeek nabírat open-source vývojáře do uzavřené bety. Zájemci mají doložit zkušenosti s projekty souvisejícími s Agent Harness a poskytnout své GitHub ID i ukázky práce .
Tým Harness měl vzniknout v březnu 2026 po příchodu Cui Tianyi do DeepSeek . Tvrzení o jeho konkrétních předchozích pozicích v TSY Capital a Jane Street se však opírá pouze o jeden blogový zdroj a nebylo nezávisle potvrzeno . Datum veřejného vydání frameworku DeepSeek neoznámil .
V4 Flash cílí na případy, kde je důležitá kombinace nízké ceny, velkého kontextu a vysoké propustnosti. Může jít například o:
Vývojáři si mohou vybrat mezi API a vlastním provozem. API odstraňuje potřebu pořizovat desítky či stovky gigabajtů vah a řešit infrastrukturu, zatímco otevřené váhy dávají firmám větší kontrolu nad daty, nasazením a úpravami modelu.
Strategie DeepSeek se v dostupných analýzách spojuje s představou, že levné a schopné modely mohou urychlit cestu k obecné umělé inteligenci. Ceny 0,14 a 0,28 dolaru za milion tokenů spolu s licencí MIT představují nejviditelnější praktický projev tohoto přístupu .
DeepSeek přitom soutěží s čínskými společnostmi Alibaba a její řadou Qwen, ByteDance a jejím modelem Doubao, Moonshot AI, MiniMax nebo Z.AI . V4 se podle některých zdrojů od konkurence odlišuje otevřenými vahami, milionovým kontextem a permisivní licencí MIT .
Objevily se také zprávy o přípravách DeepSeek na IPO. Konkrétní termín, upisovatelé ani potvrzené podrobnosti k případnému vstupu na burzu však z dostupných podkladů nevyplývají .
Při interpretaci novinek kolem DeepSeek je dobré oddělit ověřené technické údaje od tvrzení, která se objevují jen v jednotlivých článcích:
Jisté je zatím především to, že DeepSeek V4 Flash kombinuje velmi nízkou cenu API, otevřené váhy a infrastrukturu připravenou na dlouhý kontext. Pokud se zároveň podaří dotáhnout Harness do veřejně dostupného nástroje, může DeepSeek soutěžit nejen kvalitou samotného modelu, ale i celým prostředím pro tvorbu AI agentů.