DeepSeek के अनुसार, V4.1 Flash के KV कैश को पिछली पीढ़ी की तुलना में केवल एक चौथाई HBM और एक आठवां SSD स्टोरेज चाहिए। रिलीज के बाद दक्षिण कोरिया में Samsung Electronics और SK Hynix के शेयर इंट्राडे 3% से अधिक गिरे, क्योंकि बाजार ने AI मेमोरी मांग के अनुमान दोबारा परखे। Anthropic के CEO डारियो अमोदेई की फ्रंटियर AI क...
प्रकाशितकर्ताGPT-5.6 Terra से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek’s September 10 V4.1 Flash release, which reduced key-value cache consumption to about one-quarter of its predecessor’s high. Article summary: The selloff reflected a rapid reassessment of the “AI equals ever-more memory” trade. DeepSeek’s V4.1-Flash showed that serving long-context models can be made far less memory-intensive, while Amodei’s proposed slowing o. Topic tags: general, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
DeepSeek की 10 सितंबर की V4.1-Flash घोषणा ने AI निवेश की एक सीधी-सादी धारणा को चुनौती दी: मॉडल बड़े होंगे, कॉन्टेक्स्ट लंबा होगा, AI एजेंट बढ़ेंगे—तो हाई-बैंडविड्थ मेमोरी (HBM), NAND और स्टोरेज हार्डवेयर की जरूरत लगातार तेज़ी से बढ़ेगी।
मॉडल का दावा यह नहीं था कि AI को मेमोरी की जरूरत नहीं रहेगी। लेकिन उसने दिखाया कि किसी तय AI वर्कलोड को चलाने के लिए आवश्यक मेमोरी, मॉडल आर्किटेक्चर और कैश इंजीनियरिंग से काफी घटाई जा सकती है। 61
25
की-वैल्यू (KV) कैश वह मेमोरी है जिसमें मॉडल किसी अनुरोध को प्रोसेस करते समय अटेंशन-स्टेट से जुड़ी जानकारी संभालकर रखता है। लंबे कॉन्टेक्स्ट वाली बातचीत और AI एजेंटों के लिए यह खासा अहम है, क्योंकि इससे मॉडल को हर बार पूरा पुराना संदर्भ दोबारा प्रोसेस नहीं करना पड़ता।
DeepSeek का कहना है कि V4.1-Flash का KV कैश पिछली पीढ़ी के मुकाबले सिर्फ एक-चौथाई HBM और एक-आठवां SSD स्टोरेज मांगता है। 61 मॉडल कार्ड के अनुसार, इसके पीछे causal encoder-decoder डिज़ाइन है, जिसमें डिकोडर का वैश्विक KV कैश अंतिम encoder hidden states से प्रोजेक्ट किया जाता है। साथ ही, SWA Bounded Replay नाम की डिप्लॉयमेंट तकनीक कुछ sliding-window कैश स्टेट्स को SSD पर स्थायी रूप से रखने की जरूरत घटाती है।
52
रिलीज की स्वतंत्र रिपोर्टिंग में वैश्विक KV-कैश फुटप्रिंट करीब 890 बाइट प्रति टोकन बताया गया—V4-Flash का लगभग एक-चौथाई। अनुमान यह भी था कि समान KV-कैश क्षमता में मॉडल करीब चार से आठ गुना अधिक उपयोगकर्ताओं को संभाल सकता है। 53 DeepSeek के मुताबिक, मॉडल इनपुट प्रोसेसिंग (prefill) के दौरान प्रति टोकन 8 अरब और आउटपुट जनरेशन (decoding) के दौरान 16 अरब पैरामीटर सक्रिय करता है, जिससे इनपुट-भारी एजेंट वर्कलोड में दक्षता बढ़ाने का लक्ष्य है।
52
बाजार का तत्काल सवाल यह नहीं था कि AI सिस्टमों को मेमोरी चाहिए या नहीं—उन्हें चाहिए। असली सवाल था कि इन्फरेंस के हर यूनिट आउटपुट पर लगने वाली मेमोरी कई अनुमान से कहीं तेजी से घट सकती है या नहीं।
यदि तुलनीय मॉडल एक निश्चित HBM या स्टोरेज पूल के साथ अधिक लंबी-कॉन्टेक्स्ट रिक्वेस्ट एक साथ चला सकता है, तो क्लाउड कंपनियां मौजूदा इन्फ्रास्ट्रक्चर से ज्यादा थ्रूपुट निकाल सकती हैं। इससे HBM, DRAM, एंटरप्राइज SSD और उनसे जुड़े स्टोरेज उपकरणों की भविष्य की यूनिट बिक्री, आपूर्ति की तंगी और कीमत तय करने की क्षमता के अनुमानों पर जोखिम पैदा हुआ।
रिपोर्टों के अनुसार, रिलीज के बाद कोरिया में Samsung Electronics और SK Hynix—दोनों के शेयर इंट्राडे 3% से अधिक गिरे। 17 चिंता इसलिए व्यापक हुई क्योंकि AI-इन्फ्रास्ट्रक्चर कारोबार में मेमोरी निर्माता, स्टोरेज, नेटवर्किंग और कंप्यूट आपूर्तिकर्ता एक-दूसरे से जुड़े हैं। मेमोरी फुटप्रिंट कम होने से मॉडल डिप्लॉय करने का अर्थशास्त्र बदल सकता है, भले ही हर हार्डवेयर श्रेणी की मांग एक जैसी प्रभावित न हो।
SanDisk का उदाहरण दिखाता है कि निवेश का तर्क AI मांग की अपेक्षाओं के प्रति कितना संवेदनशील हो गया था। इस अवधि के बाजार आंकड़ों में शेयर का 52-सप्ताह का दायरा लगभग 85 डॉलर से 2,354 डॉलर था, जबकि व्यापक विश्लेषक सहमति Buy या Moderate Buy बनी हुई थी। 35
37 लेकिन सकारात्मक रेटिंग भी उस मूल अनिश्चितता को खत्म नहीं करती कि भविष्य की स्टोरेज मांग का कितना हिस्सा लगातार अधिक मेमोरी-गहन इन्फरेंस आर्किटेक्चर पर निर्भर है।
DeepSeek की खबर दक्षता से जुड़ा झटका थी। डारियो अमोदेई की “pace the frontier” अपील ने AI क्षमता-वृद्धि की रफ्तार, और उसके परिणामस्वरूप इन्फ्रास्ट्रक्चर खर्च की गति, पर अलग सवाल खड़ा किया।
सितंबर के अपने निबंध में Anthropic के CEO ने कहा कि कंपनियों को अग्रणी AI मॉडल क्षमताओं को बेहतर बनाने की रफ्तार जानबूझकर धीमी करनी चाहिए और मिले समय का इस्तेमाल alignment तथा सुरक्षा कार्य के लिए करना चाहिए। उन्होंने कंपनियों के भीतर काम करने वाले स्वतंत्र तृतीय-पक्ष मूल्यांकनकर्ताओं, लोकतांत्रिक देशों की कंपनियों के बीच समन्वय और अंततः सरकारों के बीच समझौतों का प्रस्ताव रखा। 4
5
यह सभी AI विकास को रोकने की अपील नहीं थी। फिर भी, अन्य प्रमुख AI नेताओं के सार्वजनिक समर्थन ने बाजार को यह सोचने पर मजबूर किया कि स्वैच्छिक समन्वय या भविष्य की नीति, एक्सेलरेटर, डेटा सेंटर और मेमोरी पर होने वाले खर्च की रफ्तार घटा सकते हैं। उस सप्ताहांत Nasdaq 100 फ्यूचर्स के 1% नीचे रहने की सूचना दी गई। 8
इन दोनों घटनाक्रमों ने निवेशकों के लिए असहज संयोजन बनाया: DeepSeek ने संकेत दिया कि AI सेवाओं को प्रति वर्कलोड कम मेमोरी लग सकती है, जबकि फ्रंटियर AI की रफ्तार नियंत्रित करने की बहस ने वर्कलोड की वृद्धि धीमी पड़ने की आशंका खड़ी की।
निवेशक माइकल बरी ने AI विकास धीमा करने की अपीलों को “self-serving” कहा। उनका तर्क था कि धीमापन स्थापित फ्रंटियर लैब्स को लाभ पहुंचा सकता है और छोटे प्रतिद्वंद्वियों के लिए आगे निकलना कठिन बना सकता है। उन्होंने यह भी सवाल उठाया कि मौजूदा AI चैटबॉट कृत्रिम सामान्य बुद्धिमत्ता (AGI) तक जाने के रास्ते पर हैं या नहीं। 15
बरी की टिप्पणियां प्रोत्साहनों की आलोचना हैं, कंपनियों के इरादों का प्रमाण नहीं। इसी तरह, सुरक्षा संबंधी संदेशों को संभावित IPO के प्रचार से जोड़ने वाले दावों को स्थापित तथ्य के बजाय बरी के आरोप के रूप में ही देखा जाना चाहिए। 11
15
सबसे ठोस निष्कर्ष सीमित, लेकिन महत्वपूर्ण है: DeepSeek ने AI-मेमोरी निवेश तर्क के एक सरलीकृत संस्करण को चुनौती दी। उसने दिखाया कि सॉफ्टवेयर, मॉडल आर्किटेक्चर, क्वांटाइजेशन और कैश प्रबंधन तकनीकें इन्फरेंस की मेमोरी तीव्रता को उल्लेखनीय रूप से कम कर सकती हैं। 52
55
लेकिन इससे यह साबित नहीं होता कि कुल मेमोरी मांग घटेगी। घोषित कटौती इन्फरेंस के दौरान KV कैश से संबंधित है और DeepSeek की पिछली आर्किटेक्चर से तुलना पर आधारित है। यह दावा नहीं है कि पूरा मॉडल या डेटा सेंटर 75% कम HBM और 87.5% कम SSD इस्तेमाल करता है। न ही इससे मॉडल वेट्स या प्रशिक्षण में लगने वाली मेमोरी खत्म होती है। 25
कम सर्विंग लागत उपयोग बढ़ा भी सकती है: सस्ता इन्फरेंस अधिक उपयोगकर्ता, लंबे कॉन्टेक्स्ट और अधिक AI-एजेंट लूप सक्षम कर सकता है। अंतिम मांग इस पर निर्भर करेगी कि कौन-सी ताकत हावी होती है—हर रिक्वेस्ट की बेहतर दक्षता, या रिक्वेस्ट की संख्या और जटिलता में वृद्धि।
DeepSeek V4.1-Flash ने HBM, NAND या AI इन्फ्रास्ट्रक्चर के दीर्घकालिक पक्ष को खारिज नहीं किया। उसने उसे अधिक शर्तों पर निर्भर जरूर बना दिया। अब यह मान लेना पर्याप्त नहीं कि AI उपयोग बढ़ने का अर्थ हर वर्कलोड पर मेमोरी खपत का एक-के-बदले-एक बढ़ना होगा।
ज्यादा उपयोगी सवाल यह है कि क्या दक्षता में सुधार AI डिप्लॉयमेंट के विस्तार से तेज़ होगा। DeepSeek ने प्रमाण दिया कि इन्फरेंस काफी हल्का हो सकता है; लेकिन इसके बाद वैश्विक AI उपयोग, प्रशिक्षण का पैमाना और हार्डवेयर मांग कितनी तेजी से बढ़ेगी, इसका फैसला अभी नहीं हुआ है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
DeepSeek के अनुसार, V4.1 Flash के KV कैश को पिछली पीढ़ी की तुलना में केवल एक चौथाई HBM और एक आठवां SSD स्टोरेज चाहिए।
DeepSeek के अनुसार, V4.1 Flash के KV कैश को पिछली पीढ़ी की तुलना में केवल एक चौथाई HBM और एक आठवां SSD स्टोरेज चाहिए। रिलीज के बाद दक्षिण कोरिया में Samsung Electronics और SK Hynix के शेयर इंट्राडे 3% से अधिक गिरे, क्योंकि बाजार ने AI मेमोरी मांग के अनुमान दोबारा परखे।
Anthropic के CEO डारियो अमोदेई की फ्रंटियर AI क्षमता वृद्धि की रफ्तार नियंत्रित करने की अपील ने दूसरी चिंता जोड़ी: AI इन्फ्रास्ट्रक्चर पर खर्च अपेक्षा से धीमा बढ़ सकता है।