Obrázky lze podle dokumentace předávat několika způsoby: jako data vložená přímo do požadavku, prostřednictvím externí URL nebo přes Files API. Dokumentace Responses API výslovně popisuje předávání obrázků s tímto modelem.
To je zajímavé především pro tvůrce AI agentů. Agent může nejprve interpretovat screenshot, graf, naskenovaný dokument nebo webovou stránku a teprve potom rozhodnout, jaký nástroj použije. DeepSeek zároveň dokumentuje integraci s Codexem, kde je Vision Exp uveden jako možnost s podporou obrazového vstupu.
Oficiální poznámky k vydání uvádějí také podporu modelu v nástroji DeepSeek Harness 0.1.1. Dokumentace pro GitHub Copilot však mezi modely v nabídce jmenuje V4 Pro a V4 Flash a popisuje zpracování obrázků přes jiný, již nainstalovaný Copilot model. Sama o sobě tedy nepotvrzuje, že je Vision Exp přímo dostupný v tomto výběru.
Hlavní tvrzení DeepSeeku zní, že Vision Exp zachovává textový výkon V4-Flash a zároveň přináší výrazný skok v multimodálních agentních benchmarcích. Podle společnosti se jeho schopnosti v této oblasti přibližují Claude Opus 4.8.
V sekundárním zpravodajství se objevují například výsledky 64,3 v testu Chartography, 36,5 v ApexBench Pass@1, 27,3 v Agents’ Last Exam a 35,0 v ZeroBench Pass@5. Jde však o čísla převzatá z pokrytí oznámení DeepSeeku, nikoli o podrobnou a nezávisle reprodukovatelnou evaluaci napříč konkurenčními poskytovateli.
Rozdíl mezi těmito dvěma věcmi není kosmetický. Tvrzení, že je model „blízko Opusu 4.8“, neznamená, že Claude celkově poráží, že jej překonává v každém úkolu nebo že nabízí stejnou spolehlivost v produkci. Dostupné podklady neobsahují neutrální srovnání se stejnými prompty, nástroji, latencí, chybovostí a náklady na straně DeepSeeku i Anthropic.
Nejstřízlivější závěr je proto užší: DeepSeek skutečně uvedl zdokumentovaný API model s podporou obrazu a jeho vlastní výsledky naznačují významné zlepšení oproti textovému V4-Flash v úlohách, kde záleží na vizuálním vstupu. Jeho přesné postavení vůči Claude, OpenAI, Googlu a dalším čínským laboratořím zůstává nepotvrzené.
Dostupné katalogy uvádějí cenu 0,22 USD za milion vstupních tokenů a 0,66 USD za milion výstupních tokenů. Model má kontextové okno o velikosti 1 milionu tokenů. Oficiální ceník DeepSeeku potvrzuje účtování za milion tokenů a zahrnuje
deepseek-v4-flash-vision-exp v tabulce modelů.
Obrázky se pro účely API účtování převádějí na tokeny. Podle zprávy citující zveřejněné pokyny DeepSeeku může jeden obrázek představovat až 384 tokenů a používá cenovou strukturu V4-Flash. Skutečná cena vizuálního workflow proto závisí na počtu a velikosti obrázků, množství doprovodného textu, délce odpovědi i opakovaném posílání stejného kontextu.
Anthropic uvádí pro Claude Opus 4.8 cenu 5 USD za milion základních vstupních tokenů a 25 USD za milion výstupních tokenů. Samostatně účtuje také cache a rychlý režim.
Na první pohled je tedy DeepSeek podstatně levnější. To je dobrý důvod k testování, nikoli ale automatický důkaz nižších celkových nákladů. Levnější model může v praxi vyžadovat více pokusů, častěji chybovat při volání nástrojů nebo potřebovat dodatečné zpracování obrázků.
Oba modely se překrývají v použití, ale jejich pozice na trhu je odlišná:
Strategie DeepSeeku je zřejmá: přinést obrazové schopnosti do levnější modelové kategorie a současně tvrdit výkon blízký prémiovému frontier modelu v multimodálních agentních úlohách. Z dostupných podkladů nelze říct, že Claude poráží DeepSeek ve všech benchmarcích. Výhodou Claude v tomto srovnání je spíše doloženější vyzrálost, produktové možnosti a zavedenější ekosystém nástrojů.
Rozhodovat by se mělo úloha od úlohy. Pro pipeline, která čte screenshoty nebo vytahuje údaje z grafů, může Vision Exp nabídnout dostatečnou kvalitu za mnohem nižší cenu. U autonomního workflow s vysokými nároky je ale důležitější konzistence, přesnost volání nástrojů, chování při odmítnutí, monitoring, podpora a schopnost zotavit se z chyb.
Význam novinky nespočívá jen v tom, že DeepSeek umí odpovídat na otázky k obrázku. Vizuální vstup se stále více stává součástí agentní práce: programovací agenti mohou číst screenshoty, browser agenti interpretovat webové stránky a podnikové systémy kombinovat dokumenty, grafy a volání nástrojů.
Řada DeepSeek V4 už od začátku zdůrazňuje dlouhý kontext a agentní úlohy, přičemž společnost popisuje Flash jako rychlejší a úspornější variantu v rámci rodiny. Vision Exp tento směr rozšiřuje na multimodální agenty namísto vytvoření samostatného modelu určeného pouze k analýze obrázků.
Dostupné důkazy přesto nestačí k prohlášení, že DeepSeek předstihl Anthropic, OpenAI, Google nebo přední čínské laboratoře. Chybí nezávislé srovnání za stejných podmínek a experimentální API model nelze automaticky stavět na roveň vyzrálému vlajkovému produktu.
Ano, pokud test proběhne kontrolovaně.
Praktické srovnání by mělo Vision Exp postavit proti Claude Opus 4.8 a současnému produkčnímu modelu na stejných úlohách kombinujících obrázky a nástroje. Vyplatí se sledovat zejména:
Zatím tedy platí opatrně pozitivní verdikt: DeepSeek V4 Flash Vision Exp je důvěryhodný nový multimodální API experiment s atraktivní ceníkovou cenou a užitečnými rozhraními pro vývojáře. Tvrzení o výkonu blízkém Claude Opus 4.8 stojí za praktické ověření, ale zatím jej nelze vydávat za nezávisle potvrzený fakt.