Die Kernfunktionen von Raiden lassen sich in drei Hauptbereiche unterteilen:
Transfer zwischen Instanzen. Raiden überträgt Key-Value-Tensoren von Prefill-TPU-Instanzen zu Decode-TPU-Instanzen in einer disaggregierten Serving-Architektur. Dies ermöglicht die Trennung dieser Phasen auf dedizierter Hardware . Dies ist dieselbe grundlegende Aufgabe, die NVIDIAs NIXL in GPU-basierten Umgebungen erfüllt .
Mechanismen zum Auslagern. Raiden bietet die zugrunde liegenden Mechanismen, um KV-Cache-Daten aus dem TPU-Speicher auf externe Speicherstufen auszulagern. Dies unterstützt ein hierarchisches Cache-Management, ähnlich dem, was NIXL mit NVMe- und RDMA-Backends bietet . Dies ist entscheidend, um die effektive Cache-Kapazität über den teuren On-Chip-Speicher hinaus zu erweitern.
TPU-eigener Datentransport. Im Gegensatz zu NVIDIAs GPUDirect-RDMA-Stack arbeitet Raiden über Googles TPU-Verbindungsnetzwerk (ICI) und ist für TPU v5e und neuere Hardware optimiert . Es ist also von Grund auf für Googles Beschleuniger-Architektur konzipiert und nicht von einem GPU-zentrierten Ansatz abgeleitet.
Die folgende Tabelle fasst die Unterschiede der beiden Bibliotheken in den wichtigsten Dimensionen zusammen:
| Merkmal | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Open-Source-Veröffentlichung | August 2026 (Apache-2.0) | GTC 2025 (Open Source) |
| Zielhardware | TPU v5e und neuer | NVIDIA GPUs (Hopper, Blackwell) |
| Kernfunktion | KV-Cache-Transfer und -Auslagerung für disaggregierte Inferenz | KV-Cache-Transfer und -Auslagerung für disaggregierte Inferenz |
| Transport-Backends | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Integration in Inferenz-Engines | vLLM TPU-Plugin, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Auslagerung auf externen Speicher | Host-Speicher, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Ökosystem-Reife | Früh – erst kürzlich als Open Source veröffentlicht | Fortgeschrittener – AWS EFA-Unterstützung, Produktionseinsätze |
Die Veröffentlichung von TPU Raiden ist Teil eines klaren und sich beschleunigenden Branchentrends hin zur Öffnung des Inferenz-Software-Stacks.
Beide Hyperscaler-Wettbewerber öffnen ihre Stacks. NVIDIA hat NIXL zusammen mit dem Dynamo-Inferenz-Framework auf der GTC 2025 als Open Source bereitgestellt . Google externalisiert schrittweise seine TPU-Software: zunächst durch die vLLM-TPU-Integration, dann durch das Kubernetes-native Framework llm-d für verteilte Inferenz – und nun mit Raiden .
Disaggregierte Inferenz ist zum Standard geworden. Die Trennung von Prefill- und Decode-Phasen verbessert die Latenz bis zum ersten Token und die Ressourcenauslastung – macht aber den schnellen KV-Cache-Transfer zum kritischen Leistungsengpass . Sowohl Raiden als auch NIXL existieren, um genau dieses Problem zu lösen .
Der Kampf gegen die Vendor-Lock-in verlagert sich auf die Datenbewegungsebene. NIXL wird als „herstellerneutral“ beschrieben und unterstützt AWS EFA, nicht nur NVIDIAs eigene Verbindungen . Raiden integriert sich ebenfalls in offene Frameworks (vLLM, SGLang, llm-d). Beide Bibliotheken sind so konzipiert, dass sie ihre jeweiligen Hardware-Ökosysteme für Entwickler attraktiver machen, anstatt proprietäre APIs zu erzwingen .
Das Ökosystem konvergiert hin zu steckbaren KV-Connector-Schnittstellen. Die KVConnector-API von vLLM akzeptiert jetzt NIXL- und Mooncake-Connector, und die Architektur ist darauf ausgelegt, jedes Backend – einschließlich Raiden – aufzunehmen. Dies ermöglicht es Betreibern, die Transportschicht auszutauschen, ohne die Inferenz-Engine zu ändern . Diese Steckbarkeit ist in Multi-Accelerator-Umgebungen, in denen Hardware-Flexibilität entscheidend ist, von großer Bedeutung.
TPU Raiden adressiert eine grundlegende Skalierungsherausforderung. Mit dem Wachstum großer Sprachmodelle wird der KV-Cache, den sie während der Inferenz erzeugen, enorm – er übersteigt oft den On-Chip-Speicher einzelner Beschleuniger. Die effiziente Bewegung dieser Daten zwischen Prefill- und Decode-Knoten ist der Unterschied zwischen einem reaktionsschnellen Inferenzsystem und einem, das unter Daten-Transportengpässen leidet .
Mit der Öffnung von Raiden signalisiert Google nicht nur, dass es mit NVIDIAs NIXL gleichzieht – es zeigt auch, dass die TPU-basierte Inferenz ein ernstzunehmender Kandidat für produktive KI-Workloads ist. Die Bibliothek gibt TPU-Betreibern dieselbe Klasse von Werkzeugen an die Hand, die GPU-Betreiber seit der Veröffentlichung von NIXL haben: eine fein abgestimmte Kontrolle darüber, wie KV-Cache-Daten zwischen Beschleunigern, Speicherhierarchien und externen Speicherstufen bewegt werden.
Für die gesamte KI-Branche bedeutet die Veröffentlichung von Raiden, dass die disaggregierte Inferenz auf TPUs nun eine praktikable Option mit der entsprechenden Tool-Unterstützung ist. Entwickler, die Googles TPU-Hardware für die Produktionsinferenz einsetzen, können dieselben Architekturmuster für die Disaggregation nutzen, die auf NVIDIA-GPU-Clustern bereits Standard sind – ohne an proprietäre APIs für die Datenbewegung gebunden zu sein.