TensorCast एक प्रस्तावित “Tensor as a Service” (TaaS) परत है, जो मॉडल वेट, KV Cache और अन्य टेंसर स्टेट की पहचान, लोकेशन, आवाजाही और उपयोग को कंप्यूटेशन से अलग करके मैनेज करती है। [1] इसका उद्देश्य इन्फरेंस इंजन, नेटवर्क और स्टोरेज में अलग अलग बने टेंसर मैनेजमेंट सिस्टम की जगह एक साझा, प्रोग्रामेबल नियंत्रण परत देना...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is TensorCast, the unified programmable tensor lifecycle management layer proposed by Peking University, StepFun, and Beijing Universit. Article summary: TensorCast is a proposed “Tensor as a Service” (TaaS) layer: a distributed, programmable system for managing the identity, placement, movement, transformation, sharing, and materialization of tensor state independently o. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
TensorCast को बड़े AI मॉडल चलाने वाले सिस्टम के लिए प्रस्तावित “Tensor-as-a-Service” (TaaS) परत के रूप में समझा जा सकता है। यह एक वितरित और प्रोग्रामेबल सिस्टम है, जो टेंसर स्टेट की पहचान, स्वामित्व, लोकेशन, प्लेसमेंट, ट्रांसफर, रूपांतरण, शेयरिंग और मेमोरी में दोबारा उपलब्ध कराने जैसी पूरी जीवन-चक्र प्रक्रियाओं को उस कंप्यूटेशन से अलग संभालता है, जो उस टेंसर को बनाता या इस्तेमाल करता है। 1
इस प्रस्ताव को पेकिंग यूनिवर्सिटी, AI कंपनी StepFun और Beijing University of Posts and Telecommunications के शोधकर्ताओं ने पेश किया है। इसका मूल विचार यह है कि मॉडल वेट, KV Cache और इंटरमीडिएट स्टेट को अलग-अलग सिस्टमों में बिखरे हुए डेटा की तरह न संभालकर, उन्हें एक साझा और प्रोग्रामेबल टेंसर ऑब्जेक्ट के रूप में मैनेज किया जाए। 1
बड़े भाषा मॉडल (LLM) की सर्विंग में सिर्फ मॉडल वेट लोड करना ही चुनौती नहीं है। सिस्टम को लगातार बदलने वाले KV Cache ब्लॉक्स और अन्य इंटरमीडिएट टेंसर स्टेट को भी कई सर्वर, GPU, नेटवर्क और स्टोरेज माध्यमों के बीच संभालना पड़ता है। पारंपरिक आर्किटेक्चर में इन कामों के लिए अलग-अलग इन्फरेंस इंजन, शेड्यूलर, नेटवर्क पाथ और स्टोरेज बैकएंड बनाए जाते हैं। इससे एक सिस्टम में बनाई गई नीति को दूसरे घटकों के साथ जोड़ना मुश्किल हो जाता है। 1
TensorCast इस समस्या को टेंसर लाइफसाइकिल मैनेजमेंट की एक अलग सिस्टम-लेयर बनाकर हल करने का प्रयास करता है। एप्लिकेशन यह बता सकती है कि किसी टेंसर के साथ क्या होना चाहिए—जैसे उसे किसी दूसरे Worker पर पहुंचाना, पहले से लोड करना या उसकी कॉपी बनाना—और रनटाइम क्लस्टर के संसाधनों के बीच प्लेसमेंट, डेटा मूवमेंट और मटीरियलाइजेशन को लागू करता है। 1
यह सामान्य ऑब्जेक्ट स्टोर से अलग है, जहां डेटा प्रायः एक अपारदर्शी ब्लॉब की तरह दिखता है। यह कंप्यूट-केंद्रित फ्रेमवर्क से भी अलग है, क्योंकि उसका मुख्य फोकस टास्क शेड्यूल करना नहीं, बल्कि टेंसर स्टेट के पूरे जीवन-चक्र को मैनेज करना है। 1
मल्टी-टर्न बातचीत में किसी यूजर सेशन को एक इन्फरेंस इंस्टेंस से दूसरे पर ले जाना पारंपरिक सिस्टम में जटिल हो सकता है। रिक्वेस्ट राउटर, इन्फरेंस इंजन के KV Cache लॉजिक और कैश या नेटवर्क बैकएंड—तीनों में समन्वित बदलाव की जरूरत पड़ सकती है।
TensorCast में नीति पहले सेशन से जुड़े KV टेंसर ऑब्जेक्ट की पहचान कर सकती है, उन्हें नए Worker पर प्लेस या मटीरियलाइज करने का अनुरोध कर सकती है और आगे आने वाली रिक्वेस्ट को उस Worker की ओर भेज सकती है। टेंसर को ढूंढना, ट्रांसफर करना और सही मेमोरी से जोड़ना लाइफसाइकिल रनटाइम संभालता है। 1
इसका अर्थ यह नहीं है कि माइग्रेशन की लागत खत्म हो जाती है। मुख्य लाभ यह है कि माइग्रेशन की नीति को कई आपस में जुड़े घटकों में अलग-अलग लागू करने के बजाय टेंसर लाइफसाइकिल लेयर पर एक बार व्यक्त किया जा सकता है। इससे कैश की लोकेशन के आधार पर रूटिंग, मॉडल वेट का पुनः उपयोग और संबंधित स्टेट को एक ही स्थान पर रखने जैसी क्रॉस-कंपोनेंट रणनीतियों को बनाना और तैनात करना आसान हो सकता है। 1
शोधकर्ताओं ने TensorCast को vLLM और SGLang के साथ जोड़ा। मूल्यांकन में मॉडल वेट मटीरियलाइजेशन, वेट सिंक्रोनाइजेशन, KV Cache मैनेजमेंट और प्रोग्रामेबल रिक्वेस्ट रूटिंग जैसे उपयोग-मामले शामिल थे। 1
रिपोर्ट के अनुसार, KV Cache में TensorCast का प्रदर्शन विशेष रूप से इसी काम के लिए बनाए गए Mooncake सिस्टम के मुकाबले प्रतिस्पर्धी रहा। साथ ही, TensorCast कई सिस्टम घटकों के बीच नीतियां लागू करने की अतिरिक्त लचीलापन देता है। 1
Qwen3-235B-A22B मॉडल का एक इंस्टेंस शुरू करने के मामले में पेपर ने सामान्य वितरित फाइल सिस्टम की तुलना में 228.6 गुना तक तेज स्टार्टअप रिपोर्ट किया। इस मॉडल में कुल 235 अरब पैरामीटर हैं, जिनमें 22 अरब पैरामीटर सक्रिय होते हैं। 1
2
उच्च-कॉन्करेंसी वाले मल्टी-टर्न एजेंट वर्कलोड में TensorCast की प्रोग्रामेबल नीति ने median time-to-first-token (TTFT) को 93.2% तक घटाने की रिपोर्ट दी। TTFT वह समय है, जो यूजर की रिक्वेस्ट के बाद मॉडल के पहला टोकन देने तक लगता है। 1
TensorCast का महत्व केवल किसी एक बेंचमार्क में तेज प्रदर्शन से नहीं, बल्कि इसकी आर्किटेक्चरल सोच से जुड़ा है। यदि टेंसर स्टेट को इन्फरेंस इंजन, नेटवर्क और स्टोरेज से अलग एक साझा संसाधन की तरह मैनेज किया जा सके, तो मॉडल तेजी से शुरू किए जा सकते हैं, KV Cache की लोकेशन के आधार पर ट्रैफिक भेजा जा सकता है और पहले से मौजूद टेंसर स्टेट का दोबारा उपयोग किया जा सकता है।
इससे elastic और stateful AI इंफ्रास्ट्रक्चर में नई नीतियां बनाना आसान हो सकता है—बिना हर ऑप्टिमाइजेशन को किसी एक फ्रेमवर्क या बैकएंड के भीतर फिर से लिखे। हालांकि, ये आंकड़े शोधकर्ताओं द्वारा रिसर्च प्रीप्रिंट में बताए गए प्रयोगात्मक परिणाम हैं। स्वतंत्र पुनरुत्पादन और बड़े प्रोडक्शन वातावरण में परीक्षण के बाद ही TensorCast की वास्तविक तैनाती-क्षमता का पूरी तरह आकलन किया जा सकेगा। 1
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
TensorCast एक प्रस्तावित “Tensor as a Service” (TaaS) परत है, जो मॉडल वेट, KV Cache और अन्य टेंसर स्टेट की पहचान, लोकेशन, आवाजाही और उपयोग को कंप्यूटेशन से अलग करके मैनेज करती है। [1]
TensorCast एक प्रस्तावित “Tensor as a Service” (TaaS) परत है, जो मॉडल वेट, KV Cache और अन्य टेंसर स्टेट की पहचान, लोकेशन, आवाजाही और उपयोग को कंप्यूटेशन से अलग करके मैनेज करती है। [1] इसका उद्देश्य इन्फरेंस इंजन, नेटवर्क और स्टोरेज में अलग अलग बने टेंसर मैनेजमेंट सिस्टम की जगह एक साझा, प्रोग्रामेबल नियंत्रण परत देना है। [1]
Global Store मेटाडेटा और समन्वय संभालता है, जबकि Worker नोड वास्तविक डेटा ट्रांसफर करते हैं; RDMA और CUDA IPC जैसी तकनीकें अनावश्यक कॉपी घटाने में मदद करती हैं। [1][6]