2. 卸載基本功能:Raiden 提供將 KV-Cache 資料從 TPU 記憶體搬移至外部儲存層的底層機制,支援類似 NIXL 以 NVMe 和 RDMA 為後端的分層快取管理 來。這對於擴展昂貴的晶片上記憶體的有效快取容量至關重要。
3. TPU 原生傳輸:不同於 NVIDIA 的 GPUDirect RDMA 技術堆疊,Raiden 是基於 Google 的 TPU 互連架構 (ICI) 運作,並專為 TPU v5e 及更新世代的硬體進行優化 。這意味著它是從零開始為 Google 加速器架構設計,而非從 GPU 為中心的方法改寫而來。
下表總結了這兩個函式庫在關鍵面向上的比較:
| 功能 | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| 開源時間 | 2026 年 8 月 (Apache-2.0) | GTC 2025 (開源) |
| 目標硬體 | TPU v5e 及更新版本 | NVIDIA GPU (Hopper, Blackwell) |
| 核心功能 | 分離式推論的 KV-Cache 傳輸 + 卸載 | 分離式推論的 KV-Cache 傳輸 + 卸載 |
| 傳輸後端 | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| 推論引擎整合 | vLLM TPU 插件, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| 外部儲存卸載 | 主機記憶體, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| 生態成熟度 | 初期 —— 近期才開源 | 較成熟 —— 已有 AWS EFA 支援與正式部署案例 |
TPU Raiden 的釋出,是 AI 軟體堆疊加速開源化趨勢中的一環。
兩大雲端巨頭競相開源其技術堆疊。 NVIDIA 於 GTC 2025 開源了 NIXL 與 Dynamo 推論框架 。Google 則持續將 TPU 軟體對外開放:從早期的 vLLM TPU 整合,到 Kubernetes 原生的 llm-d 分散式推論框架,再到如今的 Raiden
。
分離式推論已成為標準服務架構。 將 prefill 和 decode 階段分離,能改善首次生成延遲 (TTFT) 和資源使用率,但也使得高速的 KV-Cache 傳輸成為關鍵性能瓶頸 。Raiden 和 NIXL 的誕生,皆是為了解決這個問題
。
廠商鎖定效應在資料傳輸層被打破。 NIXL 被描述為「廠商中立」,除了 NVIDIA 自家的互連架構,也支援 AWS 的 EFA 。同樣地,Raiden 也設計成能插入 vLLM、SGLang、llm-d 等開放框架。這兩個函式庫都旨在讓自家的硬體生態對開發者更具吸引力,而非強制使用專有 API
來。
生態系統正收斂至可插拔的 KV-Connector 介面。 vLLM 的 KVConnector API 現在已可接受 NIXL 和 Mooncake 連接器,其架構設計能容納任何後端——包括 Raiden——讓運維人員可以在不更換推論引擎的情況下,靈活切換傳輸層 。這種可插拔性對於需要靈活支援多種加速器的環境至關重要。
TPU Raiden 解決了一個根本的擴展難題。隨著大型語言模型不斷增長,推論時產生的 KV-Cache 也變得極其龐大——經常超出個別加速器的晶片上記憶體容量。在 prefill 和 decode 節點之間高效率地移動這些資料,決定了推論系統是反應迅速,還是因資料傳輸瓶頸而拖慢速度 來。
透過開源 Raiden,Google 不僅僅是在追趕 NVIDIA 的 NIXL 策略,更是在對市場宣示:基於 TPU 的推論已經是能承載正式 AI 工作負載的可靠選擇。這個函式庫為 TPU 維運人員提供了與 GPU 用戶同等的工具:精細控制 KV-Cache 如何在加速器、記憶體層級以及外部儲存層之間流動。
對整個 AI 產業而言,Raiden 的釋出意味著在 TPU 上進行分離式推論,如今已擁有完善的工具鏈,成為一個可行的選項。部署 Google TPU 硬體進行正式推論的開發者,現在可以運用 NVIDIA GPU 叢集上已成為標準的分離式架構模式,且無需被鎖定在專有的資料移動 API 中。