הפונקציונליות העיקרית של Raiden מתחלקת לשלוש יכולות מרכזיות:
העברת מטמון KV בין מופעים. היא מעבירה טנסורי מפתח-ערך ממופעי TPU מסוג prefill למופעי TPU מסוג decode בארכיטקטורת שירות מפוצלת, ומאפשרת הפרדה של שלבים אלה לחומרה ייעודית . זוהי אותה משימה בסיסית ש-NIXL של NVIDIA מבצעת בפריסות מבוססות GPU .
פרימיטיבים להורדה. Raiden מספקת את המנגנונים הבסיסיים להעברת נתוני מטמון KV מזיכרון TPU לשכבות אחסון חיצוניות, תומכת בניהול מטמון היררכי בדומה למה ש-NIXL עושה עם ה-backends של NVMe ו-RDMA . זה חיוני להרחבת קיבולת המטמון האפקטיבית מעבר לזיכרון המשולב היקר.
תעבורה ילידית ל-TPU. בניגוד לערימת GPUDirect RDMA של NVIDIA, Raiden פועלת על גבי רשת התקשורת הבין-מעבדית (ICI) של גוגל ומותאמת ל-TPU v5e ולחומרה חדשה יותר . המשמעות היא שהיא תוכננה מלכתחילה לארכיטקטורת המאיצים של גוגל, במקום להיות מותאמת מגישה מבוססת GPU.
הטבלה הבאה מסכמת כיצד שתי הספריות משוות בממדים מרכזיים:
| תכונה | TPU Raiden (גוגל) | NIXL (NVIDIA) |
|---|---|---|
| תאריך שחרור לקוד פתוח | אוגוסט 2026 (Apache-2.0) | GTC 2025 (קוד פתוח) |
| חומרת יעד | TPU v5e וחדש יותר | NVIDIA GPUs (Hopper, Blackwell) |
| פונקציה עיקרית | העברת מטמון KV + הורדה להסקה מפוצלת | העברת מטמון KV + הורדה להסקה מפוצלת |
| ערוצי תעבורה | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| אינטגרציה עם מנועי הסקה | תוסף vLLM TPU, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| הורדה לאחסון חיצוני | זיכרון מארח, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| בשלות אקוסיסטם | מוקדמת — שוחרר לאחרונה לקוד פתוח | בוגרת יותר — תמיכה ב-AWS EFA, פריסות ייצור |
השחרור של TPU Raiden הוא חלק ממגמה ברורה ומואצת של פתיחת ערימת התוכנה של הסקת מסקנות לקוד פתוח בתעשייה.
שני ספקי ההיפרסקאלר (ענקיות הענן) מתחרים בפתיחת הערימות שלהם. NVIDIA פתחה את NIXL לקוד פתוח לצד מסגרת Dynamo ב-GTC 2025 . גוגל מייצאת בהדרגה את תוכנת ה-TPU שלה: תחילה דרך אינטגרציית vLLM TPU, לאחר מכן דרך מסגרת ההסקה המבוזרת llm-d שילובית ל-Kubernetes, ועכשיו עם Raiden .
הסקה מפוצלת הפכה לארכיטקטורת השירות הסטנדרטית. הפרדת שלבי prefill ו-decode משפרת את זמן ההשהיה עד לטוקן הראשון ואת ניצול המשאבים — אבל היא הופכת העברת מטמון KV מהירה לצוואר הבקבוק הקריטי . גם Raiden וגם NIXL קיימות כדי לפתור בדיוק את הבעיה הזו .
נעילת ספק נאבקת בשכבת העברת הנתונים. NIXL מתוארת כ"ללא תלות בספק" ותומכת ב-AWS EFA, לא רק בתעבורה הפנימית של NVIDIA . Raiden משתלבת באופן דומה במסגרות פתוחות (vLLM, SGLang, llm-d). שתי הספריות נועדו להפוך את אקוסיסטמות החומרה שלהן לאטרקטיביות יותר למפתחים במקום לכפות ממשקי API קנייניים .
האקוסיסטם מתכנס לממשקי KV-Connector פלאג-אין. ממשק ה-KVConnector של vLLM מקבל כעת מחברים של NIXL ו-Mooncake, והארכיטקטורה נועדה להכיל כל backend — כולל Raiden — ומאפשרת למפעילים להחליף את שכבת התעבורה מבלי לשנות את מנוע ההסקה . היכולת הזו לחיבור ותחיבה היא קריטית בסביבות מרובות מאיצים שבהן גמישות חומרה חשובה.
TPU Raiden נותנת מענה לאתגר קנה מידה בסיסי. ככל שמודלי שפה גדולים גדלים, מטמון ה-KV שהם מייצרים במהלך הסקה הופך עצום — לעיתים קרובות עולה על זיכרון השבב המשולב של מאיצים בודדים. העברת נתונים אלה ביעילות בין צמתי prefill ו-decode היא ההבדל בין מערכת הסקה מגיבה לבין כזו שנתקעת מצווארי בקבוק של העברת נתונים .
על ידי פתיחת Raiden לקוד פתוח, גוגל לא רק מתאימה למהלך של NVIDIA עם NIXL — היא מאותתת שהסקה מבוססת TPU היא מתמודדת רצינית לעומסי עבודה בינה מלאכותית בייצור. הספרייה מעניקה למפעילי TPU את אותם כלים שהיו למפעילי GPU מאז שחרור NIXL: שליטה עדינה על האופן שבו נתוני מטמון KV נעים בין מאיצים, היררכיות זיכרון ושכבות אחסון חיצוניות.
לתעשיית הבינה המלאכותית הרחבה יותר, שחרור Raiden אומר שהסקה מפוצלת על TPUs היא כעת אופציה מעשית עם כלי עבודה מתאימים. מפתחים הפורסים חומרת TPU של גוגל להסקת ייצור יכולים לנצל את אותם דפוסי ארכיטקטורה מפוצלת שהפכו לסטנדרט באשכולות NVIDIA GPU, מבלי להיות נעולים בממשקי API קנייניים להעברת נתונים.