Model uvedený 21. srpna 2026 rozšiřuje DeepSeek V4 Flash o porozumění obrázkům a podle vlastního srovnání firmy porazil Claude Opus 4.8 ve 3 z 11 testů.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek’s experimental DeepSeek-V4-Flash-Vision-Exp model, released on August 21, 2026, how does it extend the existing V4-Flash te. Article summary: DeepSeek-V4-Flash-Vision-Exp is an experimental, API-only multimodal extension of DeepSeek’s V4-Flash model: it retains the base model’s text, reasoning, agent, and world-knowledge capabilities while adding image underst. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-Vision-Exp je experimentální multimodální rozšíření modelu DeepSeek V4-Flash. Společnost jej uvedla 21. srpna 2026 a přidala do něj porozumění obrazům, aniž by podle svých tvrzení opustila dosavadní schopnosti v oblasti textu, uvažování a agentních workflow. Model je dostupný prostřednictvím vývojářských API DeepSeeku.
Pro vývojáře jde především o levnější způsob, jak do praktických AI agentů přidat práci s obrazem. Srovnání s Anthropic Claude Opus 4.8 zní výrazně, důkazy však zatím stojí hlavně na benchmarku zveřejněném samotným DeepSeekem. Vydání je proto důležité pro konkurenci mezi modely, ale samo o sobě ještě nepotvrzuje obecnou shodu s vlajkovým modelem Anthropic.
Největší novinkou je obrazový vstup. Vývojář může modelu poslat text společně s obrázkem, takže agent dokáže před odpovědí nebo zavoláním nástroje interpretovat například fotografii, screenshot, graf, dokument či jiný podporovaný vizuální materiál.
V API se model označuje identifikátorem:
deepseek-v4-flash-vision-expDeepSeek uvádí, že Vision-Exp zachovává textové schopnosti rodiny V4-Flash včetně uvažování, agentů a znalostí o světě. Oficiální changelog uvádí například skóre 83,9 v Terminal Bench 2.1, 59,3 v DeepSWE a 63,6 v DSBench-Hard.
Nejde tedy jen o samostatný systém pro popisování obrázků. Model má rozšířit existující textový a agentní model o situace, v nichž musí agent pochopit, co se nachází na obrazovce nebo uvnitř obrázku.
DeepSeek tvrdí, že se Vision-Exp v multimodálních agentních testech přibližuje modelu Claude Opus 4.8 a současně si zachovává textový výkon V4-Flash. Ve zveřejněném srovnání, o němž informoval server The Next Web, nový model vedl ve 3 z 11 uvedených benchmarků.
Tento výsledek je ale potřeba číst úzce. Tvrzení, že je model „blízko Opus 4.8“, popisuje výkon ve vybrané sadě testů DeepSeeku. Neprokazuje stejnou kvalitu u všech vizuálních úloh, programování, dlouhých agentních relací ani v běžném produkčním provozu.
Oficiální changelog uvádí u Vision-Exp mimo jiné skóre 36,5 v ApexBench, 27,3 v Agents’ Last Exam, 64,3 v Chartography a 35,0 v ZeroBench Pass@5.
Tato čísla však neodpovídají na důležité praktické otázky. Výsledky benchmarků mohou výrazně ovlivnit použité prompty, nástroje, prostředí, výběr úloh, požadavky na latenci, způsob řešení chyb i metodika hodnocení. Z dostupných podkladů proto nelze sestavit definitivní žebříček modelů.
Nejopatrnější interpretace textové části je, že Vision-Exp navazuje na V4-Flash, nikoli že jej jednoznačně překonává. DeepSeek jej prezentuje jako model, který si zachovává dosavadní textové schopnosti, takže vývojář nemusí kvůli obrazovému vstupu přijít o zavedené uvažování a chování agentů.
Při výběru modelu z toho plynou tři praktické závěry:
DeepSeek zpřístupnil Vision-Exp na své API platformě. Model podporuje formáty Chat Completions, Messages a Responses, včetně kombinovaného textového a obrazového vstupu.
Obrázek lze dodat třemi způsoby:
file_id souboru nahraného přes Files API.Dokumentace uvádí podporu formátů JPEG, PNG, GIF a WebP. Responses API používá pro obrazový vstup část
input_image, která může obsahovat URL obrázku, base64 data URL nebo odkaz na nahraný soubor.
Obrazový vstup se převádí na účtované tokeny. DeepSeek uvádí, že jeden obrázek představuje nejvýše 384 vstupních tokenů a účtuje se podle cenové struktury V4-Flash.
S vydáním jsou spojovány tyto sazby V4-Flash:
Strop 384 tokenů činí náklady na obrazovou část požadavku poměrně předvídatelné. Neomezuje však cenu doprovodného textu, volání nástrojů ani generovaného výstupu. Celá interakce agenta tak může spotřebovat podstatně více tokenů než samotný obrázek.
DeepSeek současně vydal Harness 0.1.1 s přímou podporou Vision-Exp. To je důležité hlavně pro vývojáře, kteří nestavějí pouze jednorázové dotazy k obrázkům, ale agentní systémy využívající nástroje.
Součástí uvedení je také bezplatné Files API. Vývojář může obrázek nahrát jednou a v dalších požadavcích jej znovu použít prostřednictvím file_id, místo aby opakovaně posílal stejná obrazová data. DeepSeek dokumentuje odkazy na soubory ve formátu file-api-....
Opakovaně použitelné reference se hodí například tehdy, když agent v několika krocích kontroluje stejný screenshot, stránku dokumentu nebo jiný vizuální materiál. Samotné Files API může být bezplatné, inference modelu a využití tokenů se však dál účtuje.
Vision-Exp ukazuje, že se soupeření mezi AI firmami neposouvá jen v oblasti kvality modelů. Stejně důležité jsou multimodální funkce, kompatibilita API, cena, práce se soubory a nástroje pro tvorbu agentů. DeepSeek nabízí obrazové rozšíření své řady Flash za stejné zveřejněné tokenové sazby jako u V4-Flash a ve vlastním reportingu používá Anthropic Opus 4.8 jako srovnávací špičku.
Praktický význam modelu ale neurčí jediná tabulka benchmarků. Rozhodující bude, zda se osvědčí při programování podle screenshotů, analýze dokumentů, ovládání rozhraní a vizuálním používání nástrojů. Označení „experimentální“ je zároveň připomínkou, že před nasazením do kritických produkčních úloh je nutné ověřit konkrétní workflow přímo.
Nejpřesnější závěr je proto střízlivý: DeepSeek zpřístupnil levné obrazové uvažování v rámci svého existujícího API ekosystému a první firemní benchmarky naznačují významný posun ve vybraných multimodálních testech. O tom, zda se Vision-Exp stane dlouhodobou alternativou, nebo zůstane zajímavým experimentem, rozhodnou nezávislá měření, spolehlivost v praxi a skutečné přijetí mezi vývojáři.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Model uvedený 21. srpna 2026 rozšiřuje DeepSeek V4 Flash o porozumění obrázkům a podle vlastního srovnání firmy porazil Claude Opus 4.8 ve 3 z 11 testů.
Model uvedený 21. srpna 2026 rozšiřuje DeepSeek V4 Flash o porozumění obrázkům a podle vlastního srovnání firmy porazil Claude Opus 4.8 ve 3 z 11 testů. API používá identifikátor deepseek v4 flash vision exp. Jeden obrázek se pro účtování započítává nejvýše jako 384 vstupních tokenů a lze jej poslat jako base64, URL nebo přes Files API.
Společně s modelem vyšel Harness 0.1.1 a bezplatné Files API, které umožňuje nahrát obrázek jednou a opakovaně jej používat v dalších požadavcích.