La funcionalidad principal de Raiden se divide en tres capacidades fundamentales:
Movimiento de la caché KV entre instancias. Transfiere los tensores clave-valor desde las instancias TPU de prefill a las instancias TPU de decode en una arquitectura de servicio desagregado, permitiendo separar estas fases en hardware dedicado . Es el mismo trabajo que realiza NVIDIA NIXL en despliegues basados en GPU .
Primitivas de descarga (offloading). Raiden proporciona los mecanismos subyacentes para sacar los datos de la caché KV de la memoria de la TPU hacia niveles de almacenamiento externo, lo que permite una gestión jerárquica de la caché similar a la que NIXL hace con backends NVMe y RDMA . Esto es esencial para ampliar la capacidad efectiva de la caché más allá de la cara memoria integrada en el chip.
Transporte nativo para TPU. A diferencia de la pila GPUDirect RDMA de NVIDIA, Raiden opera sobre la red de interconexión propia de Google (ICI) y está optimizado para TPU v5e y hardware más reciente . Esto significa que está diseñado desde cero para la arquitectura de aceleradores de Google, en lugar de ser una adaptación de un enfoque centrado en GPU.
La siguiente tabla resume cómo se comparan ambas bibliotecas en dimensiones clave:
| Característica | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Fecha de publicación open source | Agosto 2026 (Apache-2.0) | GTC 2025 (código abierto) |
| Hardware objetivo | TPU v5e y posteriores | GPU NVIDIA (Hopper, Blackwell) |
| Función principal | Transferencia y descarga de caché KV para inferencia desagregada | Transferencia y descarga de caché KV para inferencia desagregada |
| Backends de transporte | ICI de TPU, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Integración con motores de inferencia | Plugin vLLM TPU, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Descarga a almacenamiento externo | Memoria del host, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Madurez del ecosistema | Temprana — recién publicado como open source | Más madura — soporte para AWS EFA, despliegues en producción |
La publicación de TPU Raiden es parte de una tendencia clara y acelerada hacia la apertura del software de inferencia.
Ambos hiperescalares compiten por abrir sus pilas. NVIDIA liberó NIXL junto con el framework Dynamo en la GTC 2025 . Google ha ido externalizando su software para TPU de forma constante: primero con la integración de vLLM en TPU, luego con el framework de inferencia distribuida nativo de Kubernetes llm-d, y ahora con Raiden .
La inferencia desagregada se ha convertido en la arquitectura de servicio estándar. Separar las fases de prefill y decode mejora la latencia del primer token y la utilización de los recursos, pero convierte la transferencia rápida de la caché KV en el cuello de botella crítico del rendimiento . Tanto Raiden como NIXL existen para resolver exactamente este problema .
El bloqueo de proveedor se combate en la capa de movimiento de datos. NIXL se describe como "agnóstico respecto al proveedor" y es compatible con AWS EFA, no solo con las interconexiones propias de NVIDIA . Raiden, de manera similar, se conecta a frameworks abiertos (vLLM, SGLang, llm-d). Ambas bibliotecas están diseñadas para hacer que sus respectivos ecosistemas de hardware sean más atractivos para los desarrolladores, en lugar de imponer APIs propietarias .
El ecosistema converge hacia interfaces de conexión de KV conectables. La API KVConnector de vLLM ahora acepta conectores NIXL y Mooncake, y la arquitectura está diseñada para admitir cualquier backend —incluido Raiden—, lo que permite a los operadores cambiar la capa de transporte sin modificar el motor de inferencia . Esta capacidad de conexión es fundamental en entornos con múltiples aceleradores donde la flexibilidad del hardware es importante.
TPU Raiden aborda un desafío de escalado fundamental. A medida que los modelos de lenguaje grandes crecen, la caché KV que producen durante la inferencia se vuelve enorme y a menudo supera la memoria integrada de los aceleradores individuales. Mover estos datos de manera eficiente entre los nodos de prefill y decode es la diferencia entre un sistema de inferencia que responde con fluidez y uno que se ralentiza por los cuellos de botella en la transferencia de datos .
Al abrir el código de Raiden, Google no solo está igualando la jugada de NVIDIA con NIXL, sino que está señalando que la inferencia basada en TPU es un competidor serio para cargas de trabajo de IA en producción. La biblioteca proporciona a los operadores de TPU el mismo tipo de herramientas que los operadores de GPU tienen desde el lanzamiento de NIXL: control detallado sobre cómo se mueven los datos de la caché KV entre aceleradores, jerarquías de memoria y niveles de almacenamiento externo.
Para la industria de la IA en su conjunto, la publicación de Raiden significa que la inferencia desagregada en TPUs es ahora una opción viable con las herramientas adecuadas. Los desarrolladores que desplieguen hardware TPU de Google para inferencia en producción pueden aprovechar los mismos patrones de arquitectura desagregada que se han convertido en estándar en los clústeres de GPU de NVIDIA, sin quedar atrapados en APIs de movimiento de datos propietarias.