Model deepseek v4 flash vision exp byl uveden 21. srpna 2026 a přidává k V4 Flash porozumění obrázkům; každý snímek se pro účtování započítává nejvýše jako 384 vstupních tokenů.
Research answer

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek 21. srpna 2026 uvedl experimentální model deepseek-v4-flash-vision-exp, který do API V4-Flash přidává porozumění obrazu. Vývojáři tak mohou stavět agenty, kteří nepracují jen s textem, ale dokážou kontrolovat screenshoty, uživatelská rozhraní, grafy nebo aktuální stav aplikace. 114
Největší pozornost přitahuje způsob účtování: jeden obrázek se pro potřeby fakturace převede na nejvýše 384 vstupních tokenů a účtuje se za běžnou sazbu V4-Flash. Nejde tedy o samostatný příplatek za vizuální vstup. DeepSeek zároveň tvrdí, že výkon jeho vizuálních agentů se přibližuje modelu Claude Opus 4.8. Toto srovnání však vychází z firemně uváděných výsledků a zatím nebylo nezávisle potvrzeno. 319
Model se v API volá pomocí identifikátoru deepseek-v4-flash-vision-exp. Přijímá kombinaci textu a obrázků a zachovává textové generování i práci s nástroji známou z rodiny V4-Flash. Smíšené vizuální prompty podporují rozhraní Chat Completions, Messages i Responses. 412
Nejde tedy jen o nástroj pro popis obrázků. Agent může například v opakovaném cyklu prohlédnout screenshot, rozhodnout se pro další krok, zavolat nástroj a následně zkontrolovat nový stav obrazovky. Ve zveřejněných ukázkách model generoval spustitelný kód ze screenshotů a využíval obrazový vstup při tvorbě her. 510
Vývojáři mají k dispozici tři možnosti:
file_id. 6714Files API je bezplatné a hodí se především pro aplikace, které se ke stejnému obrázku vracejí opakovaně. Opakované použití odkazu na soubor znamená, že není nutné při každém požadavku znovu přenášet stejná obrazová data. To může omezit přenosovou režii u agentů, kteří pravidelně kontrolují stejný vizuální stav. 112
DeepSeek uvádí, že každý obrázek se pro účtování tokenizuje nejvýše do 384 vstupních tokenů. Ty se účtují stejnou sazbou jako vstup u V4-Flash, takže obraz nepřechází do dražší multimodální úrovně. 3614
Jedna zveřejněná cenová tabulka uvádí ve špičce 0,44 USD za milion necachovaných vstupních tokenů a 1,32 USD za milion výstupních tokenů. U modelu je zároveň uvedeno kontextové okno o velikosti 1 milionu tokenů a maximální výstup 384 000 tokenů. 1
Některé zprávy popisují limit 384 tokenů jako méně než polovinu obrazové spotřeby uváděné u srovnatelných modelů GPT a Claude. Jde ale pouze o orientační srovnání: dodané podklady nepotvrzují shodné verze modelů, rozlišení obrázků ani stejné podmínky účtování. 327
Praktičtější závěr je jednoznačnější než porovnávání benchmarků mezi dodavateli. Agent, který často kontroluje screenshoty, může mít předvídatelné náklady na obrazový vstup za sazbu Flash, místo aby při každém pozorování potřeboval prémiový multimodální model.
DeepSeek uvádí, že nový model zachovává textové schopnosti V4-Flash včetně uvažování, znalostí o světě a funkcí pro AI agenty, přičemž k nim přidává vizuální vstup. 626
Společnost také oznámila výrazné zlepšení v benchmarcích multimodálních agentů a výkon blízký modelu Claude Opus 4.8. Některé zveřejněné tabulky skutečně staví V4-Flash-Vision-Exp u vybraných úloh poblíž Opusu 4.8, výsledky se však mezi benchmarky liší. 4192123
Formulaci „blízko Opusu 4.8“ je proto zatím vhodné chápat jako tvrzení založené na hodnocení DeepSeeku, nikoli jako důkaz rovnocennosti v běžných vizuálních agentních úlohách. Nezávislé testy teprve ukážou, jak si model poradí se spolehlivostí, přesností rozpoznávání obrazu a používáním nástrojů mimo podmínky firemního měření.
Před nasazením do produkční smyčky by měli vývojáři důkladně otestovat nastavení uvažování. Jedna praktická zkouška uvádí, že skryté reasoning tokeny mohou spotřebovat celý limit odpovědi, takže už nezbude prostor pro viditelný text. Doporučením je u relevantních vizuálních úloh režim thinking vypnout, případně zvýšit hodnotu max_tokens, aby model měl dostatek prostoru i pro skutečnou odpověď. 27
Jde o implementační varování, nikoli o obecný verdikt nad schopnostmi modelu. Pokud je uvažování zapnuté, aplikace by měla vyhradit dostatečný výstupní rozpočet jak pro interní postup modelu, tak pro odpověď určenou uživateli. Konkrétní chování a názvy parametrů je vhodné před nasazením ověřit v aktuální dokumentaci DeepSeeku.
DeepSeek v dodaných podkladech nepředkládá formální strategické vysvětlení. Konstrukce produktu ale ukazuje na zřetelný účel: zlevnit vizuální vnímání natolik, aby ho agent mohl používat opakovaně. Screenshoty, herní snímky, dashboardy a stavy aplikací jsou pro agenta užitečné jen tehdy, pokud je může pravidelně kontrolovat, aniž by se každý krok stal příliš nákladným.
Uvedení v podobě experimentální varianty Flash navíc umožňuje přidat obrazový vstup k existujícímu levnějšímu agentnímu a nástrojovému workflow. Vývojář tak nemusí celou aplikaci přesouvat na samostatnou prémiovou multimodální platformu. Novinka je proto zajímavá hlavně pro týmy, které vytvářejí agenty ovládané obrazovkou, nástroje převádějící screenshoty na kód nebo aplikace vyžadující častou vizuální zpětnou vazbu.
Bilance je zatím poměrně jasná: DeepSeek V4-Flash-Vision-Exp nabízí neobvykle nízký deklarovaný limit obrazových tokenů a několik flexibilních způsobů nahrávání. Jeho náskok v benchmarcích i chování v produkci však zůstávají tvrzeními, která je třeba ověřit. Rozumným začátkem je testování na realistických screenshotech, s přesně nastaveným výstupním rozpočtem a nezávislou kontrolou kvality.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Model deepseek v4 flash vision exp byl uveden 21. srpna 2026 a přidává k V4 Flash porozumění obrázkům; každý snímek se pro účtování započítává nejvýše jako 384 vstupních tokenů.
Model deepseek v4 flash vision exp byl uveden 21. srpna 2026 a přidává k V4 Flash porozumění obrázkům; každý snímek se pro účtování započítává nejvýše jako 384 vstupních tokenů. Obrázky lze poslat jako Base64, přes veřejnou URL nebo prostřednictvím bezplatného Files API, které umožňuje nahraný soubor opakovaně odkazovat pomocí identifikátoru file id.
DeepSeek tvrdí, že vizuální agentní výkon se blíží modelu Claude Opus 4.8. Jde však o výsledky zveřejněné firmou a při integraci je nutné hlídat výstupní rozpočet, protože režim thinking může spotřebovat celou odpověď.