Raiden 嘅核心功能可以分為三大範疇:
實例之間嘅 KV-cache 傳送。 佢可以將 key-value tensor 由預填充 TPU 實例傳去解碼 TPU 實例,令呢兩個階段可以分開喺專用硬件上運行 。呢個正正係 NVIDIA NIXL 喺 GPU 環境入面做緊嘅工作 。
卸載功能。 Raiden 提供咗基本機制,將 KV-cache 數據由 TPU 記憶體搬去外部儲存層,支援類似 NIXL 嘅分層快取管理,用 NVMe 同 RDMA 做後端 。呢個功能對於擴展有效快取容量嚟講好重要,因為可以唔使全靠貴價嘅片上記憶體。
TPU 原生傳輸。 唔同於 NVIDIA 嘅 GPUDirect RDMA 堆疊,Raiden 係行 Google 嘅 TPU 互聯網絡(ICI),並且為 TPU v5e 同更新嘅硬件做咗最佳化 。換句話講,佢係由零開始為 Google 嘅加速器架構而設計,唔係由 GPU 為本嘅方案改過嚟。
下表總結咗呢兩個庫喺關鍵範疇上嘅分別:
| 功能 | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| 開源日期 | 2026年8月 (Apache-2.0) | GTC 2025 (開源) |
| 目標硬件 | TPU v5e 同更新型號 | NVIDIA GPU (Hopper, Blackwell) |
| 核心功能 | 分離式推論嘅 KV-cache 傳送 + 卸載 | 分離式推論嘅 KV-cache 傳送 + 卸載 |
| 傳輸後端 | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| 推論引擎整合 | vLLM TPU 插件, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| 外部儲存卸載 | 主機記憶體, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| 生態成熟度 | 早期 — 最近先開源 | 較成熟 — AWS EFA 支援, 生產環境部署 |
TPU Raiden 嘅推出係業界一個清晰同加速緊嘅趨勢嘅一部分:就係將推論軟件堆疊開源。
兩大超大型雲端供應商爭住開源自己嘅堆疊。 NVIDIA 喺 GTC 2025 開源咗 NIXL 同 Dynamo 推論框架 。Google 就一直逐步將 TPU 軟件外判:先係 vLLM TPU 整合,然後係 Kubernetes 原生嘅 llm-d 分散式推論框架,而家輪到 Raiden 。
分離式推論已經成為標準服務架構。 將預填充同解碼階段分開可以改善首次輸出 token 延遲(TTFT)同資源使用率——但係咁樣就令到快速嘅 KV-cache 傳送變成關鍵嘅效能瓶頸 。Raiden 同 NIXL 就係為咗解決呢個問題而存在 。
供應商鎖死嘅戰場搬到數據傳送層。 NIXL 自稱「供應商中立」,支援 AWS EFA,唔止係 NVIDIA 自己嘅互聯網絡 。Raiden 同樣插入開放框架(vLLM, SGLang, llm-d)。兩個庫嘅設計都係為咗令自己嘅硬件生態對開發者更有吸引力,而唔係強迫人用專有 API 。
生態系統趨向可插拔嘅 KV 連接器接口。 vLLM 嘅 KVConnector API 而家支援 NIXL 同 Mooncake 連接器,而個架構設計成可以容納任何後端——包括 Raiden——令營運者可以換傳送層而唔使改推論引擎 。呢種可插拔性喺多加速器環境入面好重要,因為硬件靈活性係關鍵。
TPU Raiden 解決咗一個基本嘅擴展難題。隨住大型語言模型越嚟越大,佢哋喺推論期間產生嘅 KV-cache 變得極之大——好多時超過咗個別加速器嘅片上記憶體容量。要有效咁將呢啲數據喺預填充同解碼節點之間移動,就係一個反應快嘅推論系統同一個被數據傳送瓶頸拖慢嘅系統之間嘅分別 。
通過開源 Raiden,Google 唔單止係跟 NVIDIA 嘅 NIXL 玩法——佢係喺度表明,基於 TPU 嘅推論係生產級 AI 工作負載嘅一個認真選擇。呢個庫俾 TPU 營運者擁有同 GPU 營運者自 NIXL 推出以嚟一樣嘅工具:可以精細控制 KV-cache 數據點樣喺加速器、記憶體層級同外部儲存層之間移動。
對成個 AI 業界嚟講,Raiden 嘅推出意味住喺 TPU 上做分離式推論而家有齊啱嘅工具,係一個可行嘅選項。用 Google TPU 硬件做生產推論嘅開發者,而家可以用返喺 NVIDIA GPU 集群上成為標準嘅分離式架構模式,而唔使被鎖死喺專有嘅數據傳送 API 。