Kjernen i Raidens funksjonalitet brytes ned i tre primære egenskaper:
Overføring av KV-cache mellom instanser. Det overfører key-value-tensorer fra prefill-TPU-instanser til dekode-TPU-instanser i en disaggregert tjenestearkitektur, noe som muliggjør separasjon av disse fasene på dedikert maskinvare . Dette er den samme grunnleggende jobben som NVIDIAs NIXL utfører i GPU-baserte oppsett .
Avlastningsprimitiver. Raiden gir de underliggende mekanismene for å flytte KV-cache-data ut av TPU-minne til eksterne lagringsnivåer, og støtter hierarkisk bufferadministrasjon på samme måte som NIXL gjør med NVMe- og RDMA-grensesnitt . Dette er avgjørende for å utvide den effektive bufferkapasiteten utover det kostbare brikkenære minnet.
TPU-nativ transport. I motsetning til NVIDIAs GPUDirect RDMA-stakke, opererer Raiden over Googles TPU-sammenkoblingsnettverk (ICI) og er optimalisert for TPU v5e og nyere maskinvare . Det betyr at det er designet fra grunnen av for Googles akseleratorarkitektur, i stedet for å være tilpasset en GPU-sentrisk tilnærming.
Følgende tabell oppsummerer hvordan de to bibliotekene sammenlignes på tvers av sentrale dimensjoner:
| Funksjon | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Åpen kildekode-dato | August 2026 (Apache-2.0) | GTC 2025 (åpen kildekode) |
| Mål-maskinvare | TPU v5e og nyere | NVIDIA GPUer (Hopper, Blackwell) |
| Kjernefunksjon | KV-cache-overføring + avlasting for disaggregert inferens | KV-cache-overføring + avlasting for disaggregert inferens |
| Transportgrensesnitt | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Inferensmotor-integrasjon | vLLM TPU-plugin, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Ekstern lagringsavlasting | Vertsminne, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Økosystem-modenhet | Tidlig – nylig åpen kildekode | Mer modent – AWS EFA-støtte, produksjonsdistribusjoner |
Utgivelsen av TPU Raiden er en del av en klar og akselererende bransjetrend mot å åpne kildekoden for inferensprogramvarestakken.
Begge hyperskaleringsleverandørene kappløper om å åpne stakkene sine. NVIDIA åpnet kildekoden for NIXL sammen med Dynamo-inferensrammeverket på GTC 2025 . Google har jevnlig eksternalisert TPU-programvaren sin: først gjennom vLLM TPU-integrasjon, så gjennom det Kubernetes-native llm-d distribuerte inferensrammeverket, og nå med Raiden .
Disaggregert inferens har blitt standard tjenestearkitektur. Å skille prefill- og dekode-stadier forbedrer tid-til-første-token-latens og ressursutnyttelse – men det gjør rask KV-cache-overføring til den kritiske ytelsesflaskehalsen . Både Raiden og NIXL finnes for å løse nettopp dette problemet .
Leverandørlåsning bekjempes på databevegelseslaget. NIXL beskrives som «leverandøragnostisk» og støtter AWS EFA, ikke bare NVIDIAs egne sammenkoblinger . Raiden kobler seg tilsvarende inn i åpne rammeverk (vLLM, SGLang, llm-d). Begge bibliotekene er designet for å gjøre sine respektive maskinvareøkosystemer mer attraktive for utviklere, i stedet for å tvinge frem proprietære APIer .
Økosystemet nærmer seg pluggbare KV-koblingsgrensesnitt. vLLMs KVConnector-API aksepterer nå NIXL- og Mooncake-koblinger, og arkitekturen er designet for å håndtere ethvert grensesnitt – inkludert Raiden – slik at operatører kan bytte transportlag uten å endre inferensmotoren . Denne pluggbarheten er avgjørende for miljøer med flere akseleratorer der maskinvarefleksibilitet er viktig.
TPU Raiden adresserer en grunnleggende skaleringsutfordring. Ettersom store språkmodeller vokser, blir KV-bufferen de produserer under inferens enorm – og overgår ofte brikkenært minne på individuelle akseleratorer. Å flytte disse dataene mellom prefill- og dekode-noder effektivt er forskjellen mellom et responsivt inferenssystem og et som bremses av flaskehalser i dataoverføring .
Ved å åpne kildekoden for Raiden, matcher Google ikke bare NVIDIAs NIXL-trekk – det signaliserer at TPU-basert inferens er en seriøs kandidat for produksjons-AI-arbeidsbelastninger. Biblioteket gir TPU-operatører samme type verktøy som GPU-operatører har hatt siden NIXLs utgivelse: finmasket kontroll over hvordan KV-cache-data beveger seg mellom akseleratorer, minnehierarkier og eksterne lagringsnivåer.
For den bredere AI-bransjen betyr Raidens utgivelse at disaggregert inferens på TPU nå er et levedyktig alternativ med skikkelig verktøystøtte. Utviklere som distribuerer Googles TPU-maskinvare for produksjonsinferens, kan dra nytte av de samme disaggregert arkitekturmønstrene som har blitt standard på NVIDIA GPU-klynger, uten å bli låst til proprietære databevegelses-APIer.