卸载原语。 Raiden 提供了将 KV 缓存从 TPU 内存迁移到外部存储层的基础机制,支持层次化缓存管理,与 NIXL 利用 NVMe 和 RDMA 后端进行卸载的思路一致 来。这对于突破昂贵的片上内存容量限制至关重要。
TPU 原生传输。 与 NVIDIA 的 GPUDirect RDMA 栈不同,Raiden 运行在 Google 的 TPU 互联(ICI)之上,专为 TPU v5e 及更新硬件优化,而非从 GPU 方案移植而来 。
| 特性 | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| 开源时间 | 2026 年 8 月 (Apache-2.0) | 2025 年 GTC (开源) |
| 目标硬件 | TPU v5e 及更新 | NVIDIA GPU (Hopper, Blackwell) |
| 核心功能 | 分离式推理的 KV 缓存传输 + 卸载 | 分离式推理的 KV 缓存传输 + 卸载 |
| 传输后端 | TPU ICI、DCN TCP | NVLink、InfiniBand RDMA、RoCE、TCP、NVMe-oF、S3 |
| 推理引擎集成 | vLLM TPU 插件、llm-d、SGLang | vLLM (NixlConnector)、TensorRT-LLM、SGLang、Dynamo |
| 外部存储卸载 | 主机内存、Google Cloud Lustre | NVMe-oF、S3、DDN Infinia |
| 生态成熟度 | 早期——刚刚开源 | 更成熟——已支持 AWS EFA,有生产级部署 |
TPU Raiden 的发布并非孤立事件,而是 AI 推理软件栈加速开源浪潮的一部分。
两大超大规模云厂商正在竞相开源。 NVIDIA 在 2025 年 GTC 上开源了 NIXL 和 Dynamo 推理框架 。Google 则逐步将 TPU 软件栈外部化:从 vLLM TPU 集成,到 Kubernetes 原生的 llm-d 分布式推理框架,再到现在的 Raiden
。
分离式推理已成为标准架构。 将预填充与解码阶段分离,能显著降低首 Token 延迟、提高资源利用率——但这使得 KV 缓存的高速传输成为关键性能瓶颈 。Raiden 和 NIXL 都是为了解决这个问题而生
。
供应商锁定的战场转移到了数据移动层。 NIXL 自称“供应商无关”,甚至支持 AWS EFA 而非仅限于 NVIDIA 自有互联 。Raiden 同样接入 vLLM、SGLang 和 llm-d 等开放框架。两大库的目标都是让各自的硬件生态对开发者更具吸引力,而非强制使用私有 API
来。
生态系统正在收敛于可插拔的 KV 连接器接口。 vLLM 的 KVConnector API 已支持 NIXL 和 Mooncake 连接器,架构设计上可接入任何后端——包括 Raiden。这种可插拔性让运维人员无需更改推理引擎即可自由替换传输层 ,在多加速器环境中至关重要。
TPU Raiden 解决的是一个基础性的扩展难题。随着大语言模型的增长,推理过程中产生的 KV 缓存规模惊人——往往超过单加速器的片上内存容量。在预填充和解码节点之间高效移动这些数据的效率,直接决定了推理系统响应速度的优劣 来。
通过开源 Raiden,Google 不仅是对标 NIXL 的动作,更是向业界传递明确信号:基于 TPU 的推理已成为生产级 AI 工作负载的严肃选择。Raiden 为 TPU 运维人员提供了与 GPU 用户完全对等的工具:对 KV 缓存在加速器之间、内存层次之间以及外部存储层之间的移动进行精细控制。
对整个 AI 行业而言,Raiden 的发布意味着基于 TPU 的分离式推理如今拥有了完备的工具链。开发者可以在 Google TPU 集群上使用与 NVIDIA GPU 集群完全一致的分离式架构模式,且不会被锁定在私有数据传输 API 中。