DeepSeek V4.1 Flash podporuje kontext až jednoho milionu tokenů. Při zpracování vstupu aktivuje přibližně 8 miliard parametrů na token, při generování odpovědi 16 miliard.
PublikovalUpraveno pomocí GPT-6 SolObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
Když AI agent pracuje s dlouhou historií konverzace, dokumenty a průběžnými výsledky nástrojů, může mnohem více textu přečíst, než sám napíše. Právě pro takové úlohy je určen DeepSeek-V4.1-Flash: multimodální model s otevřeně dostupnými vahami, který používá architekturu mixture-of-experts (MoE) a podporuje kontext až jednoho milionu tokenů. Tento limit říká, kolik vstupu model přijme, nikoli že v dlouhé relaci vždy spolehlivě najde každý detail. 2
8
Méně výpočtů při čtení vstupu. Základ modelu má 552 miliard parametrů a tvoří jej 20 vrstev kauzálního enkodéru a 20 vrstev dekodéru. Globální KV cache dekodéru se odvozuje ze závěrečných stavů enkodéru, místo aby ji každá vrstva dekodéru vytvářela zvlášť. Podle DeepSeeku model při prefillu — zpracování vstupu — aktivuje přibližně 8 miliard parametrů na token; při dekódování, tedy generování výstupu, 16 miliard. Rozdíl je podstatný zejména tam, kde agent opakovaně pročítá rozsáhlý kontext, ale odpovídá stručněji. 2
8
Menší paměť pro dosavadní kontext. KV cache uchovává informace, které model využívá při navazování na předchozí tokeny. Mechanismus Compressed Sparse Attention 2 (CSA2) přiřazuje vrstvám pozornosti jeden ze tří pevných režimů — Full, Reindex a Reuse — aby mohly sdílet uložené informace a znovu používat výběr relevantních pozic. Spolu s ukládáním hlavní KV cache ve formátu FP4 to podle DeepSeeku snižuje nároky globální KV cache na 890 bajtů na token, zhruba čtvrtinu hodnoty u DeepSeek-V4-Flash. Jde o srovnání velikosti cache, nikoli o změřenou úsporu celkových nákladů při každém nasazení. 6
8
Obnovení části stavu místo jejího trvalého ukládání. Technika SWA Bounded Replay rekonstruuje chybějící stavy KV cache pro pozornost s posuvným oknem opětovným zpracováním pouze nejnovějšího okna tokenů. Tyto stavy tak není nutné trvale ukládat na SSD. Modelová dokumentace uvádí nároky na trvale uchovávanou KV cache přibližně na osmině hodnoty u V4-Flash. Tento údaj se týká jiného druhu úložiště než výše uvedená čtvrtina pro globální KV cache. 5
9
Podle údajů v modelové dokumentaci byl model trénován od začátku na multimodálním souboru o 45 bilionech tokenů. Trénování řídké pozornosti probíhalo při délce sekvence 64 tisíc tokenů a kontext byl rozšířen na jeden milion tokenů ve fázi odpovídající 34 bilionům tokenů. DeepSeek zmiňuje také nové metody předtrénování a následné trénování pomocí posilovaného učení ve větším měřítku; citované podklady však nepopisují podrobný postup této závěrečné fáze. 9
16
Model nativně pracuje s textem i obrázky a DeepSeek uvádí multimodální podporu také při zpřístupnění přes API. Z citovaných podkladů však nelze vyvodit podrobné výsledky testů obrazových schopností. 2
16
Ve vlastních hodnoceních DeepSeeku dosáhla základní verze modelu srovnatelných schopností jako V4-Pro-Base v oblasti znalostí, uvažování a programování. V oddělených hodnoticích testech firma uvádí zlepšení o 5–10 %, přestože model používá přibližně třetinu celkového počtu parametrů a čtvrtinu aktivovaných parametrů. DeepSeek dále tvrdí, že vydaná verze předčí V4-Pro v úlohách pro AI agenty. Citované výňatky ale nestačí ke spolehlivému srovnání jednotlivých benchmarků; jde o uváděné výsledky, nikoli o nezávislý přímý test. 1
16
V API DeepSeeku se model volá jako deepseek-flash. Zveřejněné váhy jsou podle modelových podkladů dostupné pod licencí MIT. Dokumentace popisuje cestu k provozování modelu přes SGLang a záznamy o modelu uvádějí také podporu prostředí Transformers a vLLM. Před nasazením je vhodné ověřit požadavky konkrétního prostředí: podporu všech multimodálních funkcí a dlouhého kontextu nelze automaticky předpokládat ve stejné podobě všude. 8
9
16
DeepSeek uvádí, že modely V4-Flash a V4-Flash-Vision-Exp ukončil; jejich starší názvy v API dočasně směrují na V4.1-Flash. Firma rovněž oznámila, že od 14. září 2026 budou požadavky na deepseek-v4-pro do uvedení V4.1-Pro směrovány na V4.1-Flash za sazby řady Flash. Pokud aplikace spoléhá na konkrétní chování verze Pro, měla by ověřovat skutečně obsluhující model, ne se řídit pouze názvem v požadavku. 16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
DeepSeek V4.1 Flash podporuje kontext až jednoho milionu tokenů. Při zpracování vstupu aktivuje přibližně 8 miliard parametrů na token, při generování odpovědi 16 miliard.
DeepSeek V4.1 Flash podporuje kontext až jednoho milionu tokenů. Při zpracování vstupu aktivuje přibližně 8 miliard parametrů na token, při generování odpovědi 16 miliard. CSA2 a ukládání KV cache ve formátu FP4 podle DeepSeeku snižují její globální nároky na 890 bajtů na token, přibližně na čtvrtinu oproti V4 Flash.
Výsledky ve srovnání s V4 Pro uvádí DeepSeek; nejde o nezávislé přímé srovnání. V API má nový model název deepseek flash.