Les fonctionnalités principales de Raiden se décomposent en trois capacités :
Déplacement inter-instance du cache KV. Il transfère les tenseurs key-value des instances TPU de préremplissage vers les instances TPU de décodage dans une architecture de service désagrégée, permettant la séparation de ces phases sur du matériel dédié . C'est la même tâche fondamentale que remplit le NIXL de NVIDIA dans les déploiements sur GPU .
Primitives de déchargement. Raiden fournit les mécanismes sous-jacents pour déplacer les données du cache KV hors de la mémoire du TPU vers des niveaux de stockage externes, prenant en charge une gestion hiérarchique du cache similaire à ce que fait NIXL avec les backends NVMe et RDMA . Cela est essentiel pour étendre la capacité effective du cache au-delà de la mémoire onéreuse sur puce.
Transport natif pour TPU. Contrairement à la pile GPUDirect RDMA de NVIDIA, Raiden fonctionne sur le tissu d'interconnexion de Google (ICI) et est optimisé pour les TPU v5e et plus récents . Cela signifie qu'il est conçu dès le départ pour l'architecture d'accélérateur de Google plutôt que d'être adapté d'une approche centrée sur les GPU.
Le tableau suivant résume la comparaison des deux bibliothèques sur les dimensions clés :
| Fonctionnalité | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Date d'open-sourcing | Août 2026 (Apache-2.0) | GTC 2025 (open source) |
| Matériel cible | TPU v5e et plus récents | GPU NVIDIA (Hopper, Blackwell) |
| Fonction principale | Transfert et déchargement du cache KV pour inférence désagrégée | Transfert et déchargement du cache KV pour inférence désagrégée |
| Backends de transport | ICI TPU, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Intégration moteur d'inférence | Plugin vLLM TPU, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Déchargement stockage externe | Mémoire hôte, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Maturité de l'écosystème | Débutant — récemment open-sourcé | Plus mature — support AWS EFA, déploiements en production |
La publication de TPU Raiden s'inscrit dans une tendance sectorielle claire et accélérée vers l'open-sourcing de la pile logicielle d'inférence.
Les deux grands fournisseurs d'hyperviseurs se livrent une course à l'open-source. NVIDIA a open-sourcé NIXL avec le framework d'inférence Dynamo au GTC 2025 . Google externalise régulièrement son logiciel TPU : d'abord avec l'intégration vLLM TPU, puis avec le framework d'inférence distribué natif Kubernetes llm-d, et maintenant avec Raiden .
L'inférence désagrégée est devenue l'architecture de service standard. La séparation des phases de préremplissage et de décodage améliore la latence du premier token (TTFT) et l'utilisation des ressources, mais rend le transfert rapide du cache KV le goulot d'étranglement critique des performances . Raiden et NIXL existent tous deux pour résoudre précisément ce problème .
Le verrouillage propriétaire se joue au niveau du déplacement des données. NIXL est décrit comme « indépendant du fournisseur » et supporte AWS EFA, et pas seulement les interconnexions de NVIDIA . Raiden s'intègre également dans des frameworks ouverts (vLLM, SGLang, llm-d). Les deux bibliothèques sont conçues pour rendre leurs écosystèmes matériels respectifs plus attractifs pour les développeurs, plutôt que d'imposer des API propriétaires .
L'écosystème converge vers des interfaces de connecteur KV enfichables. L'API KVConnector de vLLM accepte désormais les connecteurs NIXL et Mooncake, et l'architecture est conçue pour accueillir n'importe quel backend — y compris Raiden — permettant aux opérateurs de changer la couche de transport sans modifier le moteur d'inférence . Cette enfichabilité est cruciale pour les environnements multi-accélérateurs où la flexibilité matérielle est importante.
TPU Raiden répond à un défi fondamental de passage à l'échelle. À mesure que les grands modèles de langage grandissent, le cache KV qu'ils produisent pendant l'inférence devient énorme — dépassant souvent la mémoire sur puce des accélérateurs individuels. Déplacer ces données efficacement entre les nœuds de préremplissage et de décodage est ce qui différencie un système d'inférence réactif d'un système ralenti par des goulots d'étranglement de transfert de données .
En open-sourçant Raiden, Google ne se contente pas de copier le mouvement de NVIDIA avec NIXL ; il signale que l'inférence sur TPU est un candidat sérieux pour les charges de travail d'IA en production. La bibliothèque donne aux opérateurs de TPU les mêmes outils que ceux dont disposent les opérateurs de GPU depuis la sortie de NIXL : un contrôle fin sur la façon dont les données du cache KV se déplacent entre les accélérateurs, les hiérarchies mémoire et les niveaux de stockage externes.
Pour l'industrie de l'IA dans son ensemble, la publication de Raiden signifie que l'inférence désagrégée sur TPU est désormais une option viable, dotée des outils appropriés. Les développeurs déployant le matériel TPU de Google pour l'inférence en production peuvent exploiter les mêmes modèles d'architecture désagrégée qui sont devenus la norme sur les clusters GPU NVIDIA, sans être enfermés dans des API propriétaires de déplacement de données.