मॉडल 10 लाख टोकन तक का संदर्भ संभालता है, लेकिन इतनी लंबी बातचीत की हर बात सही सही याद रहने की गारंटी नहीं देता। [2][8] DeepSeek के अनुसार, इसका ग्लोबल KV कैश प्रति टोकन 890 बाइट है—पुराने V4 Flash के लगभग एक चौथाई के बराबर। [6][8] API पर इसका नाम deepseek flash है। पुराने मॉडल नामों से अनुरोध भेजने वाले डेवलपर को ज...
प्रकाशितकर्ताGPT-6 Sol से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4.1-Flash, and how do its 552B-parameter multimodal Causal Encoder–Decoder MoE architecture, 20-layer encoder and 20-layer. Article summary: DeepSeek-V4.1-Flash is DeepSeek’s multimodal, open-weight MoE model designed for long, input-heavy agent sessions. It supports contexts of up to one million tokens while reducing the computation and KV-cache storage need. Topic tags: general, academic, documentation, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, chart
किसी AI एजेंट को लंबी बातचीत, दस्तावेज़ और पिछले कदम बार-बार पढ़ने पड़ें, तो सवाल सिर्फ यह नहीं होता कि मॉडल कितना पाठ स्वीकार कर सकता है। उस इतिहास को प्रोसेस करने और उसके लिए मेमोरी बनाए रखने की लागत भी मायने रखती है। DeepSeek-V4.1-Flash इसी समस्या के लिए बनाया गया ओपन-वेट, मल्टीमॉडल मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) मॉडल है। यह 10 लाख टोकन तक का संदर्भ संभालता है। यह अधिकतम सीमा है, लंबी बातचीत में हर विवरण भरोसेमंद ढंग से ढूँढ़ लेने का वादा नहीं। 2
8
मॉडल के मुख्य ढाँचे में 552 अरब पैरामीटर हैं, लेकिन हर टोकन पर सभी सक्रिय नहीं होते। इसके 40 लेयर दो हिस्सों में बँटे हैं: 20-लेयर का कॉज़ल एनकोडर और उसके बाद 20-लेयर का डीकोडर। डीकोडर का ग्लोबल KV कैश—पहले पढ़े गए पाठ से जुड़ी जानकारी रखने वाला हिस्सा—हर डीकोडर लेयर में अलग-अलग बनाने के बजाय एनकोडर की अंतिम अवस्थाओं से तैयार किया जाता है। 2
8
DeepSeek के अनुसार, प्रीफिल यानी इनपुट पढ़ने के दौरान प्रति टोकन लगभग 8 अरब पैरामीटर सक्रिय होते हैं; डीकोड यानी जवाब लिखने के दौरान यह संख्या 16 अरब है। जब एजेंट को लंबे इनपुट पढ़ने हों, लेकिन जवाब अपेक्षाकृत छोटे देने हों, तो यह अंतर खास मायने रखता है। 2
8
CSA2 नाम की तकनीक अटेंशन लेयर को तीन तय मोड—Full, Reindex और Reuse—में रखती है। इससे लेयर कैश में रखी जानकारी और पहले चुने गए स्पार्स-अटेंशन हिस्सों का दोबारा इस्तेमाल कर सकती हैं। मुख्य KV कैश को FP4 प्रारूप में रखने के साथ DeepSeek का रिपोर्ट किया हुआ ग्लोबल कैश आकार प्रति टोकन 890 बाइट है, जो V4-Flash के मुकाबले लगभग एक-चौथाई है। यह कैश के आकार की तुलना है, हर इस्तेमाल में कुल खर्च एक-चौथाई होने का प्रमाण नहीं। 6
8
दूसरी तकनीक, SWA Bounded Replay, गायब स्लाइडिंग-विंडो अटेंशन KV जानकारी को हाल के सीमित टोकन फिर से प्रोसेस करके बनाती है। इससे उस जानकारी को SSD पर स्थायी रूप से रखने की जरूरत नहीं पड़ती। मॉडल कार्ड के अनुसार, इस तरीके से स्थायी KV कैश का आकार पुराने V4-Flash के लगभग आठवें हिस्से तक आता है। यह ऊपर बताए गए ग्लोबल KV कैश के एक-चौथाई वाले आँकड़े से अलग तुलना है। 5
9
एक मॉडल-कार्ड लिस्टिंग के मुताबिक, मॉडल को 45 लाख करोड़ टोकन वाले मल्टीमॉडल डेटा पर शुरू से प्रशिक्षित किया गया। स्पार्स-अटेंशन प्रशिक्षण में 64 हज़ार टोकन की सीक्वेंस लंबाई इस्तेमाल हुई और 34 लाख करोड़ टोकन के पड़ाव पर संदर्भ सीमा 10 लाख टोकन तक बढ़ाई गई। DeepSeek नए प्री-ट्रेनिंग तरीकों और बड़े पैमाने की रीइन्फोर्समेंट-लर्निंग पोस्ट-ट्रेनिंग को भी सुधार का कारण बताता है; उपलब्ध सामग्री पोस्ट-ट्रेनिंग की विस्तृत प्रक्रिया स्पष्ट नहीं करती। 9
16
मॉडल मूल रूप से तस्वीर और पाठ, दोनों संभालता है और DeepSeek के अनुसार API पर भी मल्टीमॉडल सुविधा उपलब्ध है। उपलब्ध उद्धृत सामग्री से विज़न बेंचमार्क के विस्तृत नतीजे स्थापित नहीं होते। 2
16
DeepSeek के अपने मूल्यांकन में बेस मॉडल ज्ञान, तर्क और कोडिंग में V4-Pro-Base के तुलनीय रहा। कंपनी के अनुसार, अलग रखे गए मूल्यांकनों में उसे 5%–10% बेहतर नतीजे मिले, जबकि कुल पैरामीटर लगभग एक-तिहाई और सक्रिय पैरामीटर एक-चौथाई थे। DeepSeek जारी किए गए मॉडल को एजेंट-आधारित कामों में V4-Pro से बेहतर भी बताता है, लेकिन उपलब्ध उद्धरण हर बेंचमार्क की भरोसेमंद तुलना नहीं देते। इन्हें कंपनी के रिपोर्ट किए हुए नतीजे समझें, स्वतंत्र आमने-सामने की जाँच नहीं। 1
16
DeepSeek API पर मॉडल का नाम deepseek-flash है। प्रकाशित वेट MIT लाइसेंस के तहत सूचीबद्ध हैं। मॉडल सामग्री में SGLang से इसे चलाने का तरीका दिया गया है; मॉडल लिस्टिंग Transformers और vLLM का समर्थन भी बताती हैं। किसी खास रनटाइम पर लंबा संदर्भ या मल्टीमॉडल सुविधा उसी तरह काम करेगी या नहीं, यह उसकी आवश्यकताएँ देखकर तय करें। 8
9
16
DeepSeek के अनुसार, V4-Flash और V4-Flash-Vision-Exp सेवानिवृत्त हो चुके हैं; उनके पुराने API नाम अस्थायी रूप से V4.1-Flash पर भेजे जा रहे हैं। कंपनी ने यह भी घोषणा की थी कि 14 सितंबर 2026 से deepseek-v4-pro पर आने वाले अनुरोध, V4.1-Pro के आने तक, Flash दरों पर V4.1-Flash को भेजे जाएँगे। यदि आपका ऐप Pro के खास व्यवहार पर निर्भर है, तो सिर्फ API नाम देखकर अनुमान लगाने के बजाय वास्तविक मॉडल की पुष्टि करें। 16
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
मॉडल 10 लाख टोकन तक का संदर्भ संभालता है, लेकिन इतनी लंबी बातचीत की हर बात सही सही याद रहने की गारंटी नहीं देता। [2][8]
मॉडल 10 लाख टोकन तक का संदर्भ संभालता है, लेकिन इतनी लंबी बातचीत की हर बात सही सही याद रहने की गारंटी नहीं देता। [2][8] DeepSeek के अनुसार, इसका ग्लोबल KV कैश प्रति टोकन 890 बाइट है—पुराने V4 Flash के लगभग एक चौथाई के बराबर। [6][8]
API पर इसका नाम deepseek flash है। पुराने मॉडल नामों से अनुरोध भेजने वाले डेवलपर को जाँचना चाहिए कि उन्हें वास्तव में कौन सा मॉडल मिल रहा है। [16]