Le funzionalità principali di Raiden si suddividono in tre capacità fondamentali:
Movimento della KV-cache tra istanze. Trasferisce i tensor chiave-valore dalle istanze TPU prefill a quelle decode in un'architettura di serving disaggregata, consentendo la separazione di queste fasi su hardware dedicato . Questo è lo stesso compito fondamentale che NVIDIA NIXL svolge nelle implementazioni basate su GPU .
Primitive di offload. Raiden fornisce i meccanismi sottostanti per spostare i dati della KV-cache dalla memoria della TPU a livelli di storage esterni, supportando una gestione gerarchica della cache simile a quella che NIXL fa con i backend NVMe e RDMA . Questo è essenziale per estendere la capacità effettiva della cache oltre la costosa memoria on-chip.
Trasporto nativo per TPU. A differenza dello stack GPUDirect RDMA di NVIDIA, Raiden opera sull'interconnessione TPU (ICI) di Google ed è ottimizzato per TPU v5e e hardware successivi . Ciò significa che è progettato da zero per l'architettura degli acceleratori di Google, piuttosto che essere adattato da un approccio incentrato sulle GPU.
La tabella seguente riassume come le due librerie si confrontano su dimensioni chiave:
| Caratteristica | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Data di open-source | Agosto 2026 (Apache-2.0) | GTC 2025 (open source) |
| Hardware target | TPU v5e e successive | GPU NVIDIA (Hopper, Blackwell) |
| Funzione principale | Trasferimento + offload KV-cache per inferenza disaggregata | Trasferimento + offload KV-cache per inferenza disaggregata |
| Backend di trasporto | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Integrazione con motori di inferenza | Plugin vLLM TPU, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Offload su storage esterno | Memoria host, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Maturità dell'ecosistema | Iniziale — recentemente open-sourcata | Più matura — supporto AWS EFA, implementazioni in produzione |
Il rilascio di TPU Raiden fa parte di un chiaro e accelerato cambiamento del settore verso l'open-source dello stack software per l'inferenza.
Entrambi i vendor hyperscaler sono in corsa per aprire i loro stack. NVIDIA ha reso open-source NIXL insieme al framework di inferenza Dynamo al GTC 2025 . Google ha esternalizzato costantemente il suo software per TPU: prima attraverso l'integrazione vLLM TPU, poi con il framework di inferenza distribuita llm-d nativo di Kubernetes, e ora con Raiden .
L'inferenza disaggregata è diventata l'architettura di serving standard. Separare le fasi di prefill e decode migliora la latenza del primo token e l'utilizzo delle risorse, ma rende il trasferimento veloce della KV-cache il collo di bottiglia critico per le prestazioni . Sia Raiden che NIXL esistono per risolvere proprio questo problema .
Il vendor lock-in viene combattuto a livello di data-movement. NIXL è descritto come "vendor-agnostic" e supporta AWS EFA, non solo le interconnessioni proprietarie di NVIDIA . Raiden si integra allo stesso modo in framework aperti (vLLM, SGLang, llm-d). Entrambe le librerie sono progettate per rendere i rispettivi ecosistemi hardware più attraenti per gli sviluppatori, piuttosto che imporre API proprietarie .
L'ecosistema converge su interfacce KV-connector collegabili. L'API KVConnector di vLLM ora accetta connettori NIXL e Mooncake, e l'architettura è progettata per ospitare qualsiasi backend, incluso Raiden, consentendo agli operatori di cambiare il livello di trasporto senza modificare il motore di inferenza . Questa collegabilità è fondamentale per ambienti multi-acceleratore dove la flessibilità hardware è importante.
TPU Raiden affronta una sfida fondamentale di scalabilità. Con la crescita dei modelli linguistici di grandi dimensioni, la KV cache che producono durante l'inferenza diventa enorme, superando spesso la memoria on-chip dei singoli acceleratori. Spostare questi dati in modo efficiente tra i nodi prefill e decode è la differenza tra un sistema di inferenza reattivo e uno appesantito dai colli di bottiglia del trasferimento dati .
Rendendo open-source Raiden, Google non si limita a eguagliare la mossa di NVIDIA con NIXL, ma segnala che l'inferenza basata su TPU è un contendente serio per i carichi di lavoro AI in produzione. La libreria dà agli operatori di TPU gli stessi strumenti che gli operatori di GPU hanno avuto dal rilascio di NIXL: controllo granulare su come i dati della KV-cache si muovono tra acceleratori, gerarchie di memoria e livelli di storage esterni.
Per il più ampio settore dell'AI, il rilascio di Raiden significa che l'inferenza disaggregata sulle TPU è ora un'opzione praticabile con gli strumenti adeguati. Gli sviluppatori che implementano l'hardware TPU di Google per l'inferenza in produzione possono sfruttare gli stessi modelli di architettura disaggregata che sono diventati standard sui cluster GPU NVIDIA, senza essere bloccati in API di data-movement proprietarie.