De kernfunctionaliteit van Raiden valt uiteen in drie primaire mogelijkheden:
Inter-instance KV-cache-overdracht. Het verplaatst key-value tensoren van prefill-TPU-instanties naar decode-TPU-instanties in een gedisaggregeerde serving-architectuur, waardoor deze fasen op dedicated hardware kunnen worden uitgevoerd . Dit is dezelfde fundamentele taak die NVIDIA's NIXL uitvoert in GPU-gebaseerde implementaties .
Offloading-primitieven. Raiden biedt de onderliggende mechanismen om KV-cache-gegevens uit het TPU-geheugen te verplaatsen naar externe opslagniveaus, wat hiërarchisch cachebeheer ondersteunt, vergelijkbaar met wat NIXL doet met NVMe- en RDMA-backends . Dit is essentieel voor het vergroten van de effectieve cachecapaciteit buiten het dure on-chip geheugen.
TPU-native transport. In tegenstelling tot NVIDIA's GPUDirect RDMA-stack, werkt Raiden via Google's TPU-interconnect-fabric (ICI) en is geoptimaliseerd voor TPU v5e en nieuwere hardware . Dit betekent dat het vanaf de grond af aan is ontworpen voor Google's acceleratorarchitectuur, in plaats van te zijn aangepast vanuit een GPU-gecentreerde benadering.
De volgende tabel geeft een overzicht van hoe de twee bibliotheken zich tot elkaar verhouden op belangrijke dimensies:
| Kenmerk | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Datum opensource | Augustus 2026 (Apache-2.0) | GTC 2025 (open source) |
| Doelhardware | TPU v5e en nieuwer | NVIDIA GPU's (Hopper, Blackwell) |
| Kernfunctie | KV-cache-overdracht + offloading voor gedisaggregeerde inferentie | KV-cache-overdracht + offloading voor gedisaggregeerde inferentie |
| Transport-backends | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Integratie inferentie-engine | vLLM TPU-plugin, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Externe opslag-offload | Hostgeheugen, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Ecosysteemvolwassenheid | Vroeg — recentelijk opensource geworden | Rijper — AWS EFA-ondersteuning, productie-implementaties |
De release van TPU Raiden maakt deel uit van een duidelijke en versnellende verschuiving in de sector naar het opensourcen van de softwarestack voor inferentie.
Beide hyperscaler-leveranciers racen om hun stacks open source te maken. NVIDIA heeft NIXL samen met het Dynamo-inferentieframework op GTC 2025 open source gemaakt . Google heeft gestaag zijn TPU-software geëxternaliseerd: eerst via vLLM TPU-integratie, vervolgens via het Kubernetes-native llm-d gedistribueerde inferentieframework, en nu met Raiden .
Gedisaggregeerde inferentie is de standaard serving-architectuur geworden. Het scheiden van prefill- en decode-fasen verbetert de time-to-first-token-latentie en het resourcegebruik, maar het maakt snelle KV-cache-overdracht de kritieke prestatieknelpunt . Zowel Raiden als NIXL bestaan om precies dit probleem op te lossen .
Vendor lock-in wordt bestreden op de gegevensverplaatsingslaag. NIXL wordt beschreven als "vendor-agnostic" en ondersteunt AWS EFA, niet alleen NVIDIA's eigen interconnects . Raiden plugt op dezelfde manier in op open frameworks (vLLM, SGLang, llm-d). Beide bibliotheken zijn ontworpen om hun respectieve hardware-ecosystemen aantrekkelijker te maken voor ontwikkelaars, in plaats van propriëtaire API's te forceren .
Het ecosysteem convergeert naar pluggable KV-connector-interfaces. De KVConnector-API van vLLM accepteert nu NIXL- en Mooncake-connectors, en de architectuur is ontworpen om elke backend te accommoderen — inclusief Raiden — waardoor operators de transportlaag kunnen wisselen zonder de inferentie-engine te veranderen . Deze pluggability is cruciaal voor multi-accelerator-omgevingen waar hardwareflexibiliteit van belang is.
TPU Raiden pakt een fundamentele uitdaging op het gebied van schaalbaarheid aan. Naarmate grote taalmodellen groeien, wordt de KV-cache die ze tijdens inferentie produceren enorm — vaak groter dan het on-chip geheugen van individuele acceleratoren. Het efficiënt verplaatsen van deze gegevens tussen prefill- en decode-knooppunten is het verschil tussen een responsief inferentiesysteem en een systeem dat vastloopt door gegevensoverdrachtknelpunten .
Door Raiden open source te maken, evenaart Google niet alleen de NIXL-zet van NVIDIA — het geeft ook aan dat TPU-gebaseerde inferentie een serieuze kandidaat is voor productie-AI-workloads. De bibliotheek geeft TPU-operatoren dezelfde klasse tools die GPU-operatoren hebben sinds de release van NIXL: fijnmazige controle over hoe KV-cache-gegevens bewegen tussen acceleratoren, geheugenhiërarchieën en externe opslagniveaus.
Voor de bredere AI-industrie betekent de release van Raiden dat gedisaggregeerde inferentie op TPU's nu een levensvatbare optie is met de juiste tooling. Ontwikkelaars die Google's TPU-hardware inzetten voor productie-inferentie kunnen dezelfde gedisaggregeerde architectuurpatronen gebruiken die standaard zijn geworden op NVIDIA GPU-clusters, zonder vast te zitten aan propriëtaire API's voor gegevensverplaatsing.