オフロードプリミティブ。 Raidenは、KVキャッシュデータをTPUメモリから外部ストレージ階層に移動するための基盤メカニズムを提供します。これは、NIXLがNVMeやRDMAバックエンドで行うのと同様の階層型キャッシュ管理をサポートします ソ。これは、高価なオンチップメモリを超えて実効的なキャッシュ容量を拡張するために不可欠です。
TPUネイティブ転送。 NVIDIAのGPUDirect RDMAスタックとは異なり、RaidenはGoogleのTPUインターコネクトファブリック(ICI)上で動作し、TPU v5e以降のハードウェア向けに最適化されています 。これは、GPU中心のアプローチを転用するのではなく、Googleのアクセラレータアーキテクチャのためにゼロから設計されたことを意味します。
以下の表は、主要な次元での両ライブラリの比較をまとめたものです。
| 機能 | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| オープンソース化時期 | 2026年8月 (Apache-2.0) | GTC 2025 (オープンソース) |
| ターゲットハードウェア | TPU v5e以降 | NVIDIA GPU (Hopper, Blackwell) |
| コア機能 | 非分離型推論のためのKVキャッシュ転送 + オフロード | 非分離型推論のためのKVキャッシュ転送 + オフロード |
| 転送バックエンド | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| 推論エンジン統合 | vLLM TPUプラグイン, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| 外部ストレージオフロード | ホストメモリ, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| エコシステムの成熟度 | 初期段階 — オープンソース化されたばかり | より成熟 — AWS EFAサポート、本番環境での導入実績 |
TPU Raidenのリリースは、推論ソフトウェアスタックのオープンソース化が加速する明確な業界トレンドの一部です。
両ハイパースケーラーベンダーがスタックのオープンソース化を競っています。 NVIDIAはGTC 2025で、Dynamo推論フレームワークとともにNIXLをオープンソース化しました 。Googleは、まずvLLM TPU統合、次にKubernetesネイティブな分散推論フレームワークllm-d、そして今回のRaidenと、着実にTPUソフトウェアを外部化してきました
。
非分離型推論は標準的なサービスアーキテクチャになりました。 プリフィルとデコードのステージを分離することで、初回トークン生成までのレイテンシ(TTFT)とリソース利用率が改善されますが、その代償として高速なKVキャッシュ転送が臨界的なパフォーマンスボトルネックとなります 。RaidenとNIXLはどちらも、まさにこの問題を解決するために存在します
。
ベンダーロックインはデータ移動層で戦われています。 NIXLは「ベンダーに依存しない」と説明され、NVIDIA自身のインターコネクトだけでなくAWS EFAもサポートしています 。Raidenも同様に、オープンフレームワーク(vLLM、SGLang、llm-d)にプラグインされます。両ライブラリは、プロプライエタリなAPIを強制するのではなく、それぞれのハードウェアエコシステムを開発者にとってより魅力的なものにするために設計されています
ソ。
エコシステムはプラグ可能なKVコネクタインターフェースに収束しています。 vLLMのKVConnector APIは、NIXLやMooncakeコネクタを受け入れるようになりました。このアーキテクチャは、Raidenを含むあらゆるバックエンドに対応できるように設計されており、オペレーターは推論エンジンを変更することなく転送層を交換できます 。このプラグ可能性は、ハードウェアの柔軟性が重要なマルチアクセラレータ環境では極めて重要です。
TPU Raidenは、根本的なスケーリングの課題に取り組みます。大規模言語モデルが成長するにつれて、推論中に生成されるKVキャッシュは巨大になり、個々のアクセラレータのオンチップメモリを超えることがよくあります。このデータをプリフィルノードとデコードノード間で効率的に移動することは、応答性の高い推論システムとデータ転送のボトルネックで停滞するシステムの分かれ目となります ソ。
Raidenをオープンソース化することで、GoogleはNVIDIAのNIXL戦略に単に追随しているのではなく、TPUベースの推論が本番AIワークロードの有力な選択肢であることを示しています。このライブラリは、GPUオペレーターがNIXLのリリース以降持っているものと同じクラスのツール、すなわち、KVキャッシュデータがアクセラレータ間、メモリ階層間、外部ストレージ階層間をどのように移動するかを細かく制御する能力を、TPUオペレーターに提供します。
AI業界全体にとって、Raidenのリリースは、適切なツールを備えたTPUでの非分離型推論が実行可能な選択肢となったことを意味します。GoogleのTPUハードウェアを本番推論にデプロイする開発者は、プロプライエタリなデータ移動APIに縛られることなく、NVIDIA GPUクラスターで標準となっているのと同じ非分離型アーキテクチャパターンを活用できるようになります。