أدوات إلغاء التحميل (Offloading primitives). توفر Raiden الآليات الأساسية لنقل بيانات KV-cache من ذاكرة TPU إلى مستويات تخزين خارجية، مما يدعم إدارة هرمية للذاكرة المؤقتة مشابهة لما تقدمه NIXL مع الخلفيات NVMe و RDMA . هذا ضروري لتوسيع سعة ذاكرة التخزين المؤقت الفعالة إلى ما يتجاوز الذاكرة الداخلية الباهظة الثمن على الشريحة.
نقل مخصص لـ TPU (TPU-native transport). على عكس مكتبة NVIDIA GPUDirect RDMA، تعمل Raiden عبر نسيج الربط الشبكي الداخلي لـ TPU (ICI) والمحسّن لأجيال TPU v5e والأحدث . هذا يعني أنها مصممة من الأساس لتناسب بنية جوجل المسرّعة بدلاً من تكييفها من نهج يركز على وحدات معالجة الرسوميات.
| الميزة | TPU Raiden (جوجل) | NIXL (NVIDIA) |
|---|---|---|
| تاريخ الفتح | أغسطس 2026 (Apache-2.0) | GTC 2025 (مصدر مفتوح) |
| الأجهزة المستهدفة | TPU v5e والأحدث | وحدات معالجة الرسوميات من NVIDIA (Hopper, Blackwell) |
| الوظيفة الأساسية | نقل KV-cache + إلغاء التحميل للاستدلال اللامركزي | نقل KV-cache + إلغاء التحميل للاستدلال اللامركزي |
| خلفيات النقل | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| التكامل مع محركات الاستدلال | vLLM TPU plugin, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| إلغاء التحميل للتخزين الخارجي | ذاكرة المضيف، Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| نضج النظام البيئي | مبكر - تم فتح المصدر مؤخراً | أكثر نضجاً - دعم AWS EFA، ونشر إنتاجي |
إصدار TPU Raiden هو جزء من تحول صناعي واضح ومتسارع نحو فتح مكدس برمجيات الاستدلال.
كلا شركتي الحوسبة السحابية العملاقة تتنافسان على فتح برامجهما. NVIDIA فتحت NIXL جنباً إلى جنب مع إطار عمل Dynamo في مؤتمر GTC 2025 . جوجل تعمل بشكل مطرد على إتاحة برامج TPU خارجياً: أولاً من خلال دمج vLLM مع TPU، ثم عبر إطار العمل llm-d الموزع والمتوافق مع Kubernetes، والآن مع Raiden .
أصبح الاستدلال اللامركزي هو البنية المعيارية للخدمة. فصل مرحلتي prefill و decode يحسن زمن الاستجابة حتى أول رمز (TTFT) واستخدام الموارد - ولكنه يجعل نقل KV-cache السريع هو عنق الزجاجة الحرج للأداء . كلاً من Raiden و NIXL وُجدا لحل هذه المشكلة تحديداً .
المنافسة على احتكار البائعين تدور في طبقة نقل البيانات. توصف NIXL بأنها "غير مرتبطة ببائع" وتدعم AWS EFA، وليس فقط الوصلات الداخلية لـ NVIDIA . Raiden بدورها تتكامل مع الأطر المفتوحة (vLLM, SGLang, llm-d). كلا المكتبتين مصممتان لجعل أنظمتهما البيئية الخاصة أكثر جاذبية للمطورين بدلاً من فرض واجهات برمجة تطبيقات (APIs) خاصة .
النظام البيئي يتجه نحو واجهات KV قابلة للتبديل (pluggable KV-connectors). واجهة KVConnector في vLLM تقبل الآن موصلات NIXL و Mooncake، والمعمارية مصممة لاستيعاب أي خلفية - بما في ذلك Raiden - مما يسمح للمشغلين بتبديل طبقة النقل دون تغيير محرك الاستدلال . هذه القابلية للتبديل ضرورية في بيئات تسريع متعددة حيث تكون مرونة الأجهزة أمراً مهماً.
TPU Raiden تعالج تحدياً أساسياً في التوسع. مع نمو نماذج اللغة الكبيرة، تصبح ذاكرة KV-cache التي تنتجها أثناء الاستدلال هائلة - وغالباً ما تتجاوز ذاكرة الشريحة الداخلية للمسرعات الفردية. نقل هذه البيانات بكفاءة بين عقد prefill و decode هو الفرق بين نظام استدلال سريع الاستجابة وآخر يعاني من اختناقات نقل البيانات .
من خلال فتح Raiden، فإن جوجل لا تقوم فقط بمضاهاة خطوة NVIDIA NIXL - بل تشير إلى أن الاستدلال المعتمد على TPU هو منافس جدي لأعباء عمل الذكاء الاصطناعي الإنتاجية. المكتبة تمنح مشغلي TPU نفس الفئة من الأدوات التي حصل عليها مشغلو وحدات معالجة الرسوميات منذ إصدار NIXL: تحكم دقيق في كيفية نقل بيانات KV-cache بين المسرعات، والتسلسلات الهرمية للذاكرة، ومستويات التخزين الخارجية.
بالنسبة لصناعة الذكاء الاصطناعي ككل، فإن إصدار Raiden يعني أن الاستدلال اللامركزي على TPU أصبح الآن خياراً قابلاً للتطبيق مع الأدوات المناسبة. المطورون الذين ينشرون أجهزة TPU من جوجل للاستدلال الإنتاجي يمكنهم الاستفادة من نفس أنماط المعمارية اللامركزية التي أصبحت معياراً على مجموعات وحدات معالجة الرسوميات من NVIDIA، دون أن يكونوا مقيدين بواجهات برمجة تطبيقات (APIs) خاصة بنقل البيانات.