Raiden की मुख्य क्षमताओं को तीन भागों में बांटा जा सकता है:
इंटर-इंस्टेंस KV-कैश मूवमेंट। यह एक डिसएग्रीगेटेड सर्विंग आर्किटेक्चर में प्रीफिल TPU इंस्टेंस से डिकोड TPU इंस्टेंस में की-वैल्यू टेंसर को स्थानांतरित करता है, जिससे इन चरणों को समर्पित हार्डवेयर पर अलग किया जा सकता है । यह मूल रूप से वही काम है जो NVIDIA का NIXL GPU-आधारित डिप्लॉयमेंट में करता है ।
ऑफलोडिंग प्रिमिटिव। Raiden, KV-कैश डेटा को TPU मेमोरी से बाहरी स्टोरेज टियर में ले जाने के लिए अंतर्निहित तंत्र प्रदान करता है, जो NIXL द्वारा NVMe और RDMA बैकएंड के साथ किए जाने वाले पदानुक्रमित कैश प्रबंधन के समान है । यह महंगी ऑन-चिप मेमोरी से परे प्रभावी कैश क्षमता बढ़ाने के लिए आवश्यक है।
TPU-नेटिव ट्रांसपोर्ट। NVIDIA के GPUDirect RDMA स्टैक के विपरीत, Raiden, Google के TPU इंटरकनेक्ट फैब्रिक (ICI) पर काम करता है और TPU v5e तथा नए हार्डवेयर के लिए अनुकूलित है । इसका मतलब है कि इसे GPU-केंद्रित दृष्टिकोण से अपनाए जाने के बजाय Google के एक्सेलेरेटर आर्किटेक्चर के लिए नए सिरे से डिज़ाइन किया गया है।
निम्न तालिका बताती है कि ये दोनों लाइब्रेरीज़ प्रमुख आयामों पर कैसे तुलना करती हैं:
| सुविधा | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| ओपन-सोर्स तिथि | अगस्त 2026 (Apache-2.0) | GTC 2025 (ओपन सोर्स) |
| लक्षित हार्डवेयर | TPU v5e और नया | NVIDIA GPUs (Hopper, Blackwell) |
| मुख्य कार्य | डिसएग्रीगेटेड इन्फ्रेंस के लिए KV-कैश ट्रांसफर + ऑफलोडिंग | डिसएग्रीगेटेड इन्फ्रेंस के लिए KV-कैश ट्रांसफर + ऑफलोडिंग |
| ट्रांसपोर्ट बैकएंड | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| इन्फ्रेंस इंजन एकीकरण | vLLM TPU प्लगइन, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| बाहरी स्टोरेज ऑफलोड | होस्ट मेमोरी, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| इकोसिस्टम परिपक्वता | प्रारंभिक — हाल ही में ओपन-सोर्स किया गया | अधिक परिपक्व — AWS EFA समर्थन, प्रोडक्शन डिप्लॉयमेंट |
TPU Raiden का रिलीज़ इन्फ्रेंस सॉफ्टवेयर स्टैक को ओपन-सोर्स करने की ओर एक स्पष्ट और तेज़ होती उद्योग प्रवृत्ति का हिस्सा है।
दोनों हाइपरस्केलर वेंडर अपने स्टैक को ओपन-सोर्स करने की होड़ में हैं। NVIDIA ने GTC 2025 में Dynamo इन्फ्रेंस फ्रेमवर्क के साथ NIXL को ओपन-सोर्स किया । Google लगातार अपने TPU सॉफ्टवेयर को एक्सटर्नलाइज़ कर रहा है: पहले vLLM TPU इंटीग्रेशन के माध्यम से, फिर Kubernetes-नेटिव llm-d डिस्ट्रीब्यूटेड इन्फ्रेंस फ्रेमवर्क के माध्यम से, और अब Raiden के साथ ।
डिसएग्रीगेटेड इन्फ्रेंस मानक सर्विंग आर्किटेक्चर बन गया है। प्रीफिल और डिकोड चरणों को अलग करने से टाइम-टू-फर्स्ट-टोकन लेटेंसी और संसाधन उपयोग में सुधार होता है — लेकिन यह तेज़ KV-कैश ट्रांसफर को महत्वपूर्ण प्रदर्शन अड़चन बना देता है । Raiden और NIXL दोनों इसी समस्या को हल करने के लिए मौजूद हैं ।
वेंडर लॉक-इन डेटा-मूवमेंट लेयर पर लड़ा जा रहा है। NIXL को "वेंडर-अज्ञेयवादी" बताया गया है और यह NVIDIA के अपने इंटरकनेक्ट के अलावा AWS EFA का भी समर्थन करता है । Raiden भी ओपन फ्रेमवर्क (vLLM, SGLang, llm-d) में प्लग होता है। दोनों लाइब्रेरीज़ को मालिकाना API को बाध्य करने के बजाय अपने संबंधित हार्डवेयर इकोसिस्टम को डेवलपर्स के लिए अधिक आकर्षक बनाने के लिए डिज़ाइन किया गया है ।
इकोसिस्टम प्लगेबल KV-कनेक्टर इंटरफेस पर एकत्रित हो रहा है। vLLM का KVConnector API अब NIXL और Mooncake कनेक्टर को स्वीकार करता है, और यह आर्किटेक्चर किसी भी बैकएंड (जिसमें Raiden शामिल है) को समायोजित करने के लिए डिज़ाइन किया गया है, जिससे ऑपरेटर इन्फ्रेंस इंजन को बदले बिना ट्रांसपोर्ट लेयर को बदल सकते हैं । यह प्लगेबिलिटी मल्टी-एक्सेलेरेटर वातावरण के लिए महत्वपूर्ण है जहां हार्डवेयर लचीलापन मायने रखता है।
TPU Raiden एक मौलिक स्केलिंग चुनौती का समाधान करता है। जैसे-जैसे बड़े भाषा मॉडल बढ़ते हैं, इन्फ्रेंस के दौरान उत्पन्न होने वाला KV कैश बहुत बड़ा हो जाता है — जो अक्सर व्यक्तिगत एक्सेलेरेटर की ऑन-चिप मेमोरी से अधिक होता है। इस डेटा को प्रीफिल और डिकोड नोड्स के बीच कुशलतापूर्वक ले जाना एक उत्तरदायी इन्फ्रेंस सिस्टम और डेटा-ट्रांसफर अड़चनों से जूझ रहे सिस्टम के बीच का अंतर है ।
Raiden को ओपन-सोर्स करके, Google न केवल NVIDIA के NIXL का मुकाबला कर रहा है — बल्कि यह संकेत दे रहा है कि TPU-आधारित इन्फ्रेंस प्रोडक्शन AI वर्कलोड के लिए एक गंभीर दावेदार है। यह लाइब्रेरी TPU ऑपरेटरों को वही टूल्स देती है जो GPU ऑपरेटरों के पास NIXL के रिलीज़ के बाद से हैं: KV-कैश डेटा को एक्सेलेरेटर, मेमोरी पदानुक्रम और बाहरी स्टोरेज टियर के बीच कैसे ले जाया जाए, इस पर सूक्ष्म नियंत्रण।
व्यापक AI उद्योग के लिए, Raiden के रिलीज़ का मतलब है कि TPU पर डिसएग्रीगेटेड इन्फ्रेंस अब उचित टूलिंग के साथ एक व्यवहार्य विकल्प है। प्रोडक्शन इन्फ्रेंस के लिए Google के TPU हार्डवेयर को तैनात करने वाले डेवलपर्स, मालिकाना डेटा-मूवमेंट API में बंद हुए बिना, उन्हीं डिसएग्रीगेटेड आर्किटेक्चर पैटर्न का लाभ उठा सकते हैं जो NVIDIA GPU क्लस्टर पर मानक बन गए हैं।