Fungsi inti Raiden terbagi menjadi tiga kemampuan utama:
Perpindahan KV-cache antar-instance. Raiden mentransfer tensor key-value dari instance TPU prefill ke instance TPU decode dalam arsitektur pelayanan terdisagregasi, memungkinkan pemisahan fase-fase ini ke perangkat keras khusus . Ini adalah tugas fundamental yang sama dengan yang dilakukan oleh NIXL milik NVIDIA dalam deployment berbasis GPU .
Mekanisme offloading. Raiden menyediakan mekanisme untuk memindahkan data KV-cache dari memori TPU ke tingkatan penyimpanan eksternal, mendukung manajemen cache hierarkis yang mirip dengan apa yang dilakukan NIXL dengan backend NVMe dan RDMA . Ini penting untuk memperluas kapasitas cache efektif melampaui memori on-chip yang mahal.
Transportasi native TPU. Tidak seperti tumpukan GPUDirect RDMA milik NVIDIA, Raiden beroperasi melalui kain interkoneksi TPU (ICI) milik Google dan dioptimalkan untuk TPU v5e dan perangkat keras yang lebih baru . Ini berarti Raiden dirancang dari awal untuk arsitektur akselerator Google, bukan diadaptasi dari pendekatan yang berpusat pada GPU.
Tabel berikut merangkum perbandingan kedua pustaka di beberapa dimensi kunci:
| Fitur | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Tanggal rilis open-source | Agustus 2026 (Apache-2.0) | GTC 2025 (open source) |
| Perangkat keras target | TPU v5e dan yang lebih baru | GPU NVIDIA (Hopper, Blackwell) |
| Fungsi inti | Transfer + offloading KV-cache untuk inferensi terdisagregasi | Transfer + offloading KV-cache untuk inferensi terdisagregasi |
| Backend transportasi | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Integrasi mesin inferensi | vLLM TPU plugin, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Offload penyimpanan eksternal | Memori host, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Kematangan ekosistem | Awal — baru dirilis open-source | Lebih matang — dukungan AWS EFA, deployment produksi |
Rilis TPU Raiden adalah bagian dari pergeseran industri yang jelas dan semakin cepat menuju open-source tumpukan perangkat lunak inferensi.
Kedua vendor hyperscaler berlomba membuka sumber tumpukan mereka. NVIDIA merilis NIXL sebagai open-source bersamaan dengan kerangka kerja inferensi Dynamo di GTC 2025 . Google secara bertahap mengeksternalisasi perangkat lunak TPU-nya: pertama melalui integrasi vLLM TPU, kemudian melalui kerangka kerja inferensi terdistribusi llm-d yang native Kubernetes, dan sekarang dengan Raiden .
Inferensi terdisagregasi telah menjadi arsitektur pelayanan standar. Memisahkan tahap prefill dan decode meningkatkan latensi time-to-first-token dan utilisasi sumber daya — tetapi membuat transfer KV-cache yang cepat menjadi hambatan kinerja yang kritis . Baik Raiden dan NIXL ada untuk memecahkan masalah ini .
Vendor lock-in diperangi di lapisan pergerakan data. NIXL digambarkan sebagai "vendor-agnostic" dan mendukung AWS EFA, tidak hanya interkoneksi milik NVIDIA sendiri . Raiden juga terhubung ke kerangka kerja terbuka (vLLM, SGLang, llm-d). Kedua pustaka dirancang untuk membuat ekosistem perangkat keras mereka masing-masing lebih menarik bagi pengembang, daripada memaksakan API proprietary .
Ekosistem berkumpul di antarmuka KV-connector yang dapat dicolokkan. API KVConnector vLLM sekarang menerima konektor NIXL dan Mooncake, dan arsitekturnya dirancang untuk mengakomodasi backend apa pun — termasuk Raiden — memungkinkan operator untuk mengganti lapisan transportasi tanpa mengubah mesin inferensi . Kemampuan pluggable ini sangat penting untuk lingkungan multi-akselerator di mana fleksibilitas perangkat keras sangat penting.
TPU Raiden mengatasi tantangan penskalaan fundamental. Saat model bahasa besar tumbuh, KV cache yang mereka hasilkan selama inferensi menjadi sangat besar — seringkali melebihi memori on-chip dari akselerator individu. Memindahkan data ini antara node prefill dan decode secara efisien adalah perbedaan antara sistem inferensi yang responsif dan sistem yang terbebani oleh hambatan transfer data .
Dengan merilis Raiden sebagai open-source, Google tidak hanya menyamai langkah NIXL milik NVIDIA — tetapi juga memberi sinyal bahwa inferensi berbasis TPU adalah pesaing serius untuk beban kerja AI produksi. Pustaka ini memberikan operator TPU seperangkat alat yang sama dengan yang dimiliki operator GPU sejak rilis NIXL: kontrol granular atas bagaimana data KV-cache bergerak antar akselerator, hierarki memori, dan tingkatan penyimpanan eksternal.
Bagi industri AI yang lebih luas, rilis Raiden berarti bahwa inferensi terdisagregasi pada TPU kini menjadi opsi yang layak dengan alat yang tepat. Pengembang yang menggunakan perangkat keras TPU Google untuk inferensi produksi dapat memanfaatkan pola arsitektur terdisagregasi yang sama yang telah menjadi standar di klaster GPU NVIDIA, tanpa terkunci ke dalam API pergerakan data proprietary.