Raidens kärnfunktionalitet delas upp i tre primära förmågor:
Överföring mellan instanser. Det överför key-value-tensorer från prefill-TPU-instanser till decode-TPU-instanser i en sönderdelad servningsarkitektur, vilket möjliggör separation av dessa faser på dedikerad hårdvara . Detta är samma grundläggande uppgift som NVIDIAs NIXL utför i GPU-baserade installationer .
Avlastningsprimitiver. Raiden tillhandahåller de underliggande mekanismerna för att flytta KV-cachedata från TPU-minne till externa lagringsnivåer, vilket stöder hierarkisk cachehantering liknande det NIXL gör med NVMe- och RDMA-backends . Detta är avgörande för att utöka den effektiva cachekapaciteten bortom dyrt inbyggt minne.
TPU-nativ transport. Till skillnad från NVIDIAs GPUDirect RDMA-stack arbetar Raiden över Googles TPU-interconnect fabric (ICI) och är optimerad för TPU v5e och nyare hårdvara . Detta innebär att det är designat från grunden för Googles acceleratorarkitektur snarare än anpassat från en GPU-centrerad metod.
Följande tabell sammanfattar hur de två biblioteken står sig inom nyckelområden:
| Funktion | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Släppt som öppen källkod | Augusti 2026 (Apache-2.0) | GTC 2025 (öppen källkod) |
| Målhårdvara | TPU v5e och nyare | NVIDIA GPU:er (Hopper, Blackwell) |
| Kärnfunktion | KV-cacheöverföring + avlastning för sönderdelad inferens | KV-cacheöverföring + avlastning för sönderdelad inferens |
| Transport-backends | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Integration med inferensmotorer | vLLM TPU-plugin, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Avlastning till extern lagring | Värdminne, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Ekossystemets mognad | Tidig – nyligen släppt som öppen källkod | Mer moget – AWS EFA-stöd, produktionsinstallationer |
Släppet av TPU Raiden är en del av en tydlig och accelererande branschtrend mot att öppna källkoden för inferens-mjukvarustacken.
Båda hyperscaler-leverantörerna tävlar om att öppna källkoden för sina stackar. NVIDIA släppte NIXL som öppen källkod tillsammans med Dynamo-inferensramverket på GTC 2025 . Google har successivt externaliserat sin TPU-mjukvara: först genom vLLM TPU-integration, sedan genom det Kubernetes-nativa llm-d-ramverket för distribuerad inferens, och nu med Raiden .
Sönderdelad inferens har blivit standardarkitekturen för servning. Att separera prefill- och decode-stegen förbättrar latensen för första token och resursutnyttjandet – men det gör snabb KV-cacheöverföring till den kritiska prestandaflaskhalsen . Både Raiden och NIXL finns för att lösa just detta problem .
Kampen om leverantörslåsning utkämpas på datarörelsenivån. NIXL beskrivs som "leverantörsneutralt" och stöder AWS EFA, inte bara NVIDIAs egna sammankopplingar . Raiden ansluter på samma sätt till öppna ramverk (vLLM, SGLang, llm-d). Båda biblioteken är designade för att göra sina respektive hårdvaruekossystem mer attraktiva för utvecklare snarare än att tvinga på proprietära API:er .
Ekossystemet konvergerar mot pluggbara KV-kopplingsgränssnitt. vLLM:s KVConnector API accepterar nu NIXL- och Mooncake-kopplingar, och arkitekturen är designad för att hantera vilken backend som helst – inklusive Raiden – vilket gör att operatörer kan byta transportlager utan att ändra inferensmotorn . Denna pluggbarhet är kritisk för miljöer med flera acceleratorer där hårdvaruflexibilitet är viktig.
TPU Raiden adresserar en grundläggande skalningsutmaning. I takt med att stora språkmodeller växer blir den KV-cache de producerar under inferens enorm – och överskrider ofta det inbyggda minnet hos enskilda acceleratorer. Att flytta denna data effektivt mellan prefill- och decode-noder är skillnaden mellan ett responsivt inferenssystem och ett som tyngs ner av flaskhalsar i dataöverföring .
Genom att släppa Raiden som öppen källkod matchar Google inte bara NVIDIAs NIXL-spel – det signalerar att TPU-baserad inferens är en seriös kandidat för produktions-AI-arbetsbelastningar. Biblioteket ger TPU-operatörer samma typ av verktyg som GPU-operatörer har haft sedan NIXL släpptes: finkornig kontroll över hur KV-cachedata flyttas mellan acceleratorer, minneshierarkier och externa lagringsnivåer.
För den bredare AI-branschen innebär släppet av Raiden att sönderdelad inferens på TPU nu är ett livskraftigt alternativ med rätt verktyg. Utvecklare som använder Googles TPU-hårdvara för produktionsinferens kan dra nytta av samma sönderdelade arkitekturmönster som har blivit standard på NVIDIA GPU-kluster, utan att låsas till proprietära API:er för datarörelse.