Raidens kernefunktionalitet falder i tre primære evner:
Overførsel af KV-cache mellem instanser. Det overfører key-value-tensorer fra prefill-TPU-instanser til decode-TPU-instanser i en adskilt serveringsarkitektur, hvilket muliggør adskillelse af disse faser på dedikeret hardware . Dette er den samme grundlæggende opgave, som NVIDIAs NIXL udfører i GPU-baserede installationer .
Offload-primitiver. Raiden tilbyder de underliggende mekanismer til at flytte KV-cache-data ud af TPU-hukommelsen til eksterne lagringslag, hvilket understøtter hierarkisk cache-administration svarende til det, NIXL gør med NVMe- og RDMA-backends . Dette er afgørende for at udvide den effektive cachekapacitet ud over den dyre on-chip-hukommelse.
TPU-nativ transport. I modsætning til NVIDIAs GPUDirect RDMA-stak fungerer Raiden over Googles TPU-interconnect-fabric (ICI) og er optimeret til TPU v5e og nyere hardware . Det betyder, at det er designet fra bunden til Googles acceleratorarkitektur snarere end tilpasset fra en GPU-centreret tilgang.
Følgende tabel opsummerer, hvordan de to biblioteker sammenlignes på tværs af centrale dimensioner:
| Funktion | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Open source-dato | August 2026 (Apache-2.0) | GTC 2025 (open source) |
| Målhardware | TPU v5e og nyere | NVIDIA GPU'er (Hopper, Blackwell) |
| Kernefunktion | KV-cache-overførsel + offload til adskilt inferens | KV-cache-overførsel + offload til adskilt inferens |
| Transport-backends | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Integration med inferensmotor | vLLM TPU-plugin, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Ekstern lager-offload | Værtshukommelse, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Økosystemmodenhed | Tidlig – for nylig open-sourcet | Mere moden – AWS EFA-support, produktionsinstallationer |
Udgivelsen af TPU Raiden er en del af en klar og accelererende industritrend mod at open-source inferenssoftwarestakken.
Begge hyperscaler-leverandører kappes om at open-source deres stakke. NVIDIA open-source-de NIXL sammen med Dynamo-inferensrammen ved GTC 2025 . Google har støt eksternaliseret sin TPU-software: først gennem vLLM TPU-integration, derefter gennem det Kubernetes-native llm-d distribuerede inferensframework, og nu med Raiden .
Adskilt inferens er blevet standard serveringsarkitektur. At adskille prefill- og decode-faser forbedrer time-to-first-token-latens og ressourceudnyttelse – men det gør hurtig KV-cache-overførsel til den kritiske præstationsflaskehals . Både Raiden og NIXL findes for at løse netop dette problem .
Vendor lock-in bekæmpes på dataflytningslaget. NIXL beskrives som "leverandøragnostisk" og understøtter AWS EFA, ikke kun NVIDIAs egne interconnect . Raiden integreres på samme måde i åbne rammer (vLLM, SGLang, llm-d). Begge biblioteker er designet til at gøre deres respektive hardwareøkosystemer mere attraktive for udviklere snarere end at tvinge proprietære API'er igennem .
Økosystemet konvergerer mod udskiftelige KV-connector-grænseflader. vLLM's KVConnector API accepterer nu NIXL- og Mooncake-connectors, og arkitekturen er designet til at rumme enhver backend – inklusive Raiden – hvilket giver operatører mulighed for at skifte transportlaget uden at ændre inferensmotoren . Denne udskiftelighed er afgørende i multi-acceleratormiljøer, hvor hardwarefleksibilitet er vigtig.
TPU Raiden adresserer en fundamental skaleringsudfordring. Efterhånden som store sprogmodeller vokser, bliver den KV-cache, de producerer under inferens, enorm – og overstiger ofte on-chip-hukommelsen på individuelle acceleratorer. At flytte disse data effektivt mellem prefill- og decode-noder er forskellen mellem et responsivt inferenssystem og et, der bremses af dataoverførselsflaskehalse .
Ved at open-source Raiden matcher Google ikke bare NVIDIAs NIXL-træk – det signalerer, at TPU-baseret inferens er en seriøs kandidat til produktions-AI-arbejdsbelastninger. Biblioteket giver TPU-operatører den samme klasse af værktøjer, som GPU-operatører har haft siden NIXL's udgivelse: finkornet kontrol over, hvordan KV-cache-data bevæger sig mellem acceleratorer, hukommelseshierarkier og eksterne lagringslag.
For den bredere AI-industri betyder Raidens udgivelse, at adskilt inferens på TPU'er nu er en levedygtig mulighed med ordentligt værktøj. Udviklere, der anvender Googles TPU-hardware til produktionsinferens, kan nu udnytte de samme adskilte arkitekturmønstre, der er blevet standard på NVIDIA GPU-klynger, uden at være låst til proprietære dataflytnings-API'er.