Podstawowe możliwości Raidena dzielą się na trzy główne obszary:
Przenoszenie pamięci KV między instancjami. Biblioteka przesyła tensory key-value z instancji TPU wykonujących operację prefill do instancji decode w rozproszonej architekturze, umożliwiając rozdzielenie tych faz na dedykowany sprzęt . Jest to to samo fundamentalne zadanie, które wykonuje NVIDIA NIXL w środowiskach GPU .
Mechanizmy odciążania (offloading). Raiden dostarcza narzędzi do przenoszenia danych pamięci podręcznej KV z pamięci TPU do zewnętrznych warstw przechowywania, wspierając hierarchiczne zarządzanie pamięcią, podobnie jak NIXL z backendami NVMe i RDMA . Jest to kluczowe dla zwiększenia efektywnej pojemności pamięci podręcznej poza kosztowną pamięcią na chipie.
Transport zoptymalizowany dla TPU. W przeciwieństwie do stosu GPUDirect RDMA od NVIDIA, Raiden działa przez autorskie połączenia TPU ICI (Interconnect Fabric) i jest optymalizowany pod kątem układów TPU v5e i nowszych . Oznacza to, że został zaprojektowany od podstaw dla architektury akceleratorów Google'a, a nie zaadaptowany z podejścia skoncentrowanego na GPU.
Poniższa tabela podsumowuje porównanie obu bibliotek w kluczowych wymiarach:
| Cecha | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Data udostępnienia open-source | Sierpień 2026 (Apache 2.0) | GTC 2025 (open source) |
| Docelowy sprzęt | TPU v5e i nowsze | GPU NVIDIA (Hopper, Blackwell) |
| Główna funkcja | Transfer i odciążanie pamięci KV dla rozproszonego wnioskowania | Transfer i odciążanie pamięci KV dla rozproszonego wnioskowania |
| Backendy transportowe | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Integracja z silnikami inferencyjnymi | wtyczka vLLM TPU, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Odciążanie na zewnętrzne magazyny | Pamięć hosta, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Dojrzałość ekosystemu | Wczesna – niedawno udostępniona | Bardziej dojrzała – obsługa AWS EFA, wdrożenia produkcyjne |
Wydanie TPU Raiden jest częścią wyraźnego i przyspieszającego trendu w branży polegającego na otwieraniu kodu źródłowego stosu oprogramowania do inferencji.
Obaj giganci hiperskalowi ścigają się w otwieraniu swoich stosów. NVIDIA udostępniła NIXL wraz z frameworkiem Dynamo na konferencji GTC 2025 . Google systematycznie otwiera swoje oprogramowanie dla TPU: najpierw poprzez integrację vLLM z TPU, potem przez framework llm-d zorientowany na Kubernetesa, a teraz z Raidenem .
Rozproszone wnioskowanie (disaggregated inference) stało się standardową architekturą. Rozdzielenie faz prefill i decode poprawia czas do pierwszego tokenu (TTFT) i wykorzystanie zasobów – ale czyni szybki transfer pamięci KV krytycznym wąskim gardłem wydajności . Zarówno Raiden, jak i NIXL istnieją właśnie po to, by rozwiązać ten problem .
Walka o przywiązanie do dostawcy toczy się na warstwie przesyłania danych. NIXL jest opisywany jako „niezależny od dostawcy" i obsługuje AWS EFA, a nie tylko własne połączenia NVIDIA . Raiden podobnie integruje się z otwartymi frameworkami (vLLM, SGLang, llm-d). Obie biblioteki mają na celu uczynienie swoich ekosystemów sprzętowych bardziej atrakcyjnymi dla deweloperów, zamiast narzucania własnościowych API .
Ekosystem zmierza w kierunku wtyczkowych interfejsów KV-Connector. API KVConnector w vLLM akceptuje teraz łączniki NIXL i Mooncake, a architektura została zaprojektowana tak, aby obsługiwać dowolny backend – w tym Raiden – umożliwiając operatorom wymianę warstwy transportowej bez zmiany silnika inferencyjnego . Ta wtyczkowość jest kluczowa w środowiskach z wieloma akceleratorami, gdzie elastyczność sprzętu ma znaczenie.
TPU Raiden rozwiązuje fundamentalny problem skalowania. W miarę jak modele językowe rosną, pamięć podręczna KV, którą generują podczas wnioskowania, staje się ogromna – często przekraczając pamięć na chipie pojedynczych akceleratorów. Efektywne przenoszenie tych danych między węzłami prefill i decode stanowi różnicę między responsywnym systemem inferencyjnym a takim, który jest spowalniany przez wąskie gardła transferu danych .
Otwierając kod Raidena, Google nie tylko dorównuje ruchowi NVIDIA z NIXL – sygnalizuje, że inferencja na TPU jest poważnym kandydatem do produkcyjnych obciążeń AI. Biblioteka daje operatorom TPU te same narzędzia, które operatorzy GPU mają od czasu wydania NIXL: szczegółową kontrolę nad tym, jak dane pamięci podręcznej KV przemieszczają się między akceleratorami, hierarchiami pamięci i zewnętrznymi warstwami pamięci masowej.
Dla całej branży AI wydanie Raidena oznacza, że rozproszone wnioskowanie na TPU jest teraz realną opcją z odpowiednim oprogramowaniem. Deweloperzy wdrażający sprzęt TPU Google'a do produkcyjnego wnioskowania mogą korzystać z tych samych wzorców architektury rozproszonej, które stały się standardem w klastrach GPU NVIDIA, bez blokady na własnościowe API do przesyłania danych.