21 अगस्त 2026 को जारी DeepSeek V4 Flash Vision Exp, V4 Flash की टेक्स्ट और एजेंट क्षमताओं में इमेज समझ जोड़ता है। कंपनी के प्रकाशित तुलनात्मक परीक्षणों में यह Claude Opus 4.8 से 11 में से 3 बेंचमार्क पर आगे रहा, लेकिन... API में मॉडल आईडी deepseek v4 flash vision exp है। हर तस्वीर अधिकतम 384 बिल योग्य इनपुट टोकन तक...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek’s experimental DeepSeek-V4-Flash-Vision-Exp model, released on August 21, 2026, how does it extend the existing V4-Flash te. Article summary: DeepSeek-V4-Flash-Vision-Exp is an experimental, API-only multimodal extension of DeepSeek’s V4-Flash model: it retains the base model’s text, reasoning, agent, and world-knowledge capabilities while adding image underst. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-Vision-Exp, DeepSeek के V4-Flash मॉडल का एक प्रायोगिक मल्टीमॉडल विस्तार है। 21 अगस्त 2026 को जारी इस मॉडल में तस्वीरों और अन्य विज़ुअल इनपुट को समझने की क्षमता जोड़ी गई है, जबकि टेक्स्ट, रीजनिंग, एजेंट वर्कफ़्लो और विश्व-ज्ञान से जुड़ी V4-Flash क्षमताओं को बरकरार रखने का दावा किया गया है। यह मॉडल DeepSeek के डेवलपर API के जरिए उपलब्ध है।
DeepSeek इसे ऐसे AI एजेंट्स के लिए अपेक्षाकृत कम लागत वाला विकल्प बता रहा है जिन्हें स्क्रीन पर दिख रही चीज़ों या किसी तस्वीर के भीतर की जानकारी समझनी होती है। Anthropic के Claude Opus 4.8 से इसकी तुलना ने जरूर ध्यान खींचा है, लेकिन अभी उपलब्ध बेंचमार्क सबूत मुख्य रूप से DeepSeek की अपनी रिपोर्ट पर आधारित हैं। इसलिए यह लॉन्च डेवलपर्स और मॉडल प्रतिस्पर्धा के लिए महत्वपूर्ण है, पर इससे Anthropic के फ्लैगशिप मॉडल के साथ व्यापक समानता साबित नहीं होती।
इस मॉडल का सबसे बड़ा बदलाव विज़ुअल इनपुट है। डेवलपर अब एक ही अनुरोध में टेक्स्ट और तस्वीर दोनों भेज सकते हैं। इससे कोई एजेंट फोटो, स्क्रीनशॉट, चार्ट, दस्तावेज़ या अन्य समर्थित विज़ुअल सामग्री को देखकर जवाब दे सकता है या टूल कॉल कर सकता है। API अनुरोधों में मॉडल की पहचान इस आईडी से होती है:
deepseek-v4-flash-vision-expDeepSeek के अनुसार, मॉडल V4-Flash परिवार की टेक्स्ट क्षमताओं—जैसे रीजनिंग, एजेंट कार्य और विश्व-ज्ञान—को बनाए रखता है। आधिकारिक चेंजलॉग में Terminal Bench 2.1 पर 83.9, DeepSWE पर 59.3 और DSBench-Hard पर 63.6 जैसे परिणाम दिए गए हैं।
इसका अर्थ है कि Vision-Exp केवल तस्वीरों का कैप्शन बनाने वाला अलग सिस्टम नहीं है। इसे ऐसे मौजूदा टेक्स्ट-और-एजेंट मॉडल के विस्तार के रूप में पेश किया गया है जो अब स्क्रीन या इमेज के भीतर मौजूद जानकारी को भी समझ सके।
DeepSeek का कहना है कि Vision-Exp मल्टीमॉडल-एजेंट बेंचमार्क पर Claude Opus 4.8 के करीब पहुंचता है और साथ ही V4-Flash स्तर की टेक्स्ट क्षमता बनाए रखता है। The Next Web में रिपोर्ट की गई DeepSeek की प्रकाशित तुलना के अनुसार, मॉडल 11 में से 3 बेंचमार्क पर आगे रहा।
इस दावे को सीमित संदर्भ में पढ़ना जरूरी है। “Opus 4.8 के करीब” का मतलब DeepSeek द्वारा चुने गए मूल्यांकन सेट पर करीब प्रदर्शन है; यह हर विज़ुअल टास्क, कोडिंग वर्कलोड या लंबे समय तक चलने वाले एजेंट सत्र में समान गुणवत्ता साबित नहीं करता। आधिकारिक चेंजलॉग में Vision-Exp के लिए ApexBench पर 36.5, Agents’ Last Exam पर 27.3, Chartography पर 64.3 और ZeroBench Pass@5 पर 35.0 अंक भी दिए गए हैं।
ये आंकड़े उत्पादन-स्तर के कई अहम सवालों का जवाब नहीं देते। अलग-अलग प्रॉम्प्ट, टूल वातावरण, टास्क चयन, लेटेंसी की जरूरत, विफलता से निपटने का तरीका और मूल्यांकन पद्धति परिणाम बदल सकते हैं। उपलब्ध सामग्री में पर्याप्त स्वतंत्र प्रमाण नहीं है, इसलिए इस तुलना को AI मॉडलों की अंतिम या निर्णायक रैंकिंग मानना जल्दबाजी होगी।
टेक्स्ट-आधारित इस्तेमाल के लिए Vision-Exp का सबसे बड़ा दावा स्पष्ट बढ़त नहीं, बल्कि निरंतरता है। DeepSeek इसे V4-Flash की मौजूदा टेक्स्ट क्षमताओं को बनाए रखने वाले विस्तार के रूप में पेश करता है। यानी डेवलपर इमेज इनपुट पाने के लिए उस मॉडल की स्थापित रीजनिंग और एजेंट क्षमता छोड़ने के लिए मजबूर नहीं होते।
मॉडल चुनते समय इसका व्यावहारिक मतलब इस तरह समझा जा सकता है:
DeepSeek ने Vision-Exp को अपने API प्लेटफॉर्म पर उपलब्ध कराया है। यह Chat Completions, Messages और Responses इंटरफेस के जरिए टेक्स्ट और इमेज के मिश्रित इनपुट को सपोर्ट करता है।
तस्वीरें तीन तरीकों से भेजी जा सकती हैं:
file_id के जरिए।दस्तावेज़ में JPEG, PNG, GIF और WebP इमेज फॉर्मेट समर्थित बताए गए हैं। Responses API में भी
input_image कंटेंट पार्ट के भीतर इमेज URL, base64 data URL या अपलोड की गई फाइल का संदर्भ दिया जा सकता है।
इमेज इनपुट को बिल योग्य टोकन में बदला जाता है। DeepSeek के अनुसार, एक तस्वीर अधिकतम 384 इनपुट टोकन तक योगदान करती है और उस पर V4-Flash की कीमत लागू होती है।
लॉन्च से जुड़ी प्रकाशित V4-Flash दरें इस प्रकार हैं:
384 टोकन की अधिकतम सीमा से तस्वीर वाले हिस्से की लागत का अनुमान लगाना आसान हो जाता है। हालांकि, इससे साथ भेजे गए टेक्स्ट, टूल कॉल या मॉडल द्वारा बनाए गए आउटपुट की कीमत सीमित नहीं होती। इसलिए पूरा एजेंट इंटरैक्शन केवल तस्वीर की लागत तक सीमित नहीं रहेगा और कुल टोकन उपयोग काफी अधिक हो सकता है।
DeepSeek ने Vision-Exp के साथ Harness 0.1.1 जारी किया, जिसमें इस मॉडल का सीधे इस्तेमाल करने का समर्थन दिया गया है। यह उन डेवलपर्स के लिए खासा उपयोगी हो सकता है जो अलग-अलग इमेज सवाल पूछने के बजाय टूल का इस्तेमाल करने वाले एजेंट बना रहे हैं।
लॉन्च के साथ मुफ्त Files API भी शुरू की गई। डेवलपर किसी तस्वीर को एक बार अपलोड करके बाद के अनुरोधों में file_id के जरिए दोबारा इस्तेमाल कर सकते हैं। इससे हर बार उसी तस्वीर के डेटा को फिर से भेजने की जरूरत नहीं रहती। DeepSeek के दस्तावेज़ों में ऐसे फाइल संदर्भों का प्रारूप file-api-... दिया गया है।
यदि किसी एजेंट को एक ही स्क्रीनशॉट, दस्तावेज़ के पेज या विज़ुअल सामग्री को कई चरणों में जांचना हो, तो यह सुविधा उपयोगी है। Files API से अपलोड करना मुफ्त हो सकता है, लेकिन मॉडल का इंफरेंस और टोकन उपयोग बिल योग्य बने रहते हैं।
Vision-Exp दिखाता है कि AI प्रतिस्पर्धा अब केवल मॉडल की गुणवत्ता तक सीमित नहीं रह गई है। मल्टीमॉडल क्षमता, API संगतता, कीमत, दोबारा इस्तेमाल की जा सकने वाली फाइलें और एजेंट टूलिंग—ये सभी डेवलपर के फैसले में महत्वपूर्ण भूमिका निभा रहे हैं। DeepSeek ने V4-Flash की प्रकाशित टोकन दरों पर अपनी Flash लाइन में विज़ुअल क्षमता जोड़ी है, जबकि उसकी रिपोर्ट में Anthropic का Opus 4.8 उच्च-स्तरीय तुलना बिंदु है।
इस लॉन्च का वास्तविक असर किसी एक बेंचमार्क तालिका से कम और रोजमर्रा के इस्तेमाल से अधिक तय होगा। सवाल यह है कि डेवलपर इसे स्क्रीनशॉट-आधारित कोडिंग, दस्तावेज़ विश्लेषण, इंटरफेस एजेंट और विज़ुअल टूल इस्तेमाल जैसे कामों में कितना भरोसेमंद पाते हैं। मॉडल का “experimental” लेबल यह संकेत भी देता है कि महत्वपूर्ण उत्पादन कार्यों में लगाने से पहले इन वर्कफ़्लो का सीधे परीक्षण किया जाना चाहिए।
फिलहाल सबसे संतुलित निष्कर्ष यही है: DeepSeek ने अपने मौजूदा API इकोसिस्टम के जरिए कम लागत वाली विज़ुअल रीजनिंग तक पहुंच आसान की है और शुरुआती कंपनी-रिपोर्टेड परिणाम कुछ मल्टीमॉडल परीक्षणों में मजबूत चुनौती का संकेत देते हैं। लेकिन स्वतंत्र मूल्यांकन, वास्तविक दुनिया में विश्वसनीयता और लंबे समय तक डेवलपर अपनाने से ही तय होगा कि Vision-Exp टिकाऊ विकल्प बनता है या सिर्फ एक दिलचस्प प्रायोगिक रिलीज़ रह जाता है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
21 अगस्त 2026 को जारी DeepSeek V4 Flash Vision Exp, V4 Flash की टेक्स्ट और एजेंट क्षमताओं में इमेज समझ जोड़ता है। कंपनी के प्रकाशित तुलनात्मक परीक्षणों में यह Claude Opus 4.8 से 11 में से 3 बेंचमार्क पर आगे रहा, लेकिन...
21 अगस्त 2026 को जारी DeepSeek V4 Flash Vision Exp, V4 Flash की टेक्स्ट और एजेंट क्षमताओं में इमेज समझ जोड़ता है। कंपनी के प्रकाशित तुलनात्मक परीक्षणों में यह Claude Opus 4.8 से 11 में से 3 बेंचमार्क पर आगे रहा, लेकिन... API में मॉडल आईडी deepseek v4 flash vision exp है। हर तस्वीर अधिकतम 384 बिल योग्य इनपुट टोकन तक सीमित है और उसे base64, सार्वजनिक URL या Files API के file id से भेजा जा सकता है। [3][9][10]
मॉडल के साथ Harness 0.1.1 और मुफ्त Files API भी लॉन्च हुए, जिससे स्क्रीनशॉट, दस्तावेज़ और अन्य विज़ुअल सामग्री पर काम करने वाले मल्टी टर्न एजेंट बनाना आसान हो सकता है। [2][3]