Fungsi teras Raiden terbahagi kepada tiga kebolehan utama:
Pergerakan KV-cache antara instance. Ia memindahkan tensor key-value daripada instance TPU prefill ke instance TPU decode dalam seni bina perkhidmatan terpisah, membolehkan pemisahan fasa ini ke atas perkakasan khusus . Ini adalah tugas asas yang sama dilakukan oleh NIXL NVIDIA dalam penggunaan berasaskan GPU .
Primitif pemunggahan. Raiden menyediakan mekanisme asas untuk memindahkan data KV-cache keluar dari memori TPU ke lapisan storan luaran, menyokong pengurusan cache hierarki yang serupa dengan apa yang dilakukan NIXL dengan backend NVMe dan RDMA . Ini penting untuk memanjangkan kapasiti cache efektif melebihi memori on-chip yang mahal.
Pengangkutan asli TPU. Tidak seperti tumpukan GPUDirect RDMA NVIDIA, Raiden beroperasi melalui fabrik interkoneksi TPU (ICI) Google dan dioptimumkan untuk TPU v5e dan perkakasan lebih baharu . Ini bermakna ia direka dari bawah ke atas untuk seni bina pemecut Google dan bukan diadaptasi daripada pendekatan berpusatkan GPU.
Jadual berikut meringkaskan bagaimana kedua-dua perpustakaan dibandingkan merentas dimensi utama:
| Ciri | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Tarikh sumber terbuka | Ogos 2026 (Apache-2.0) | GTC 2025 (sumber terbuka) |
| Perkakasan sasaran | TPU v5e dan lebih baharu | GPU NVIDIA (Hopper, Blackwell) |
| Fungsi teras | Pemindahan + pemunggahan KV-cache untuk inferens terpisah | Pemindahan + pemunggahan KV-cache untuk inferens terpisah |
| Backend pengangkutan | ICI TPU, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Integrasi enjin inferens | Plugin vLLM TPU, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Pemunggahan storan luaran | Memori hos, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Kematangan ekosistem | Awal — baru dibuka sumber | Lebih matang — sokongan AWS EFA, penggunaan pengeluaran |
Keluaran TPU Raiden adalah sebahagian daripada peralihan industri yang jelas dan semakin pantas ke arah sumber terbuka tumpukan perisian inferens.
Kedua-dua vendor hyperscaler berlumba untuk membuka sumber tumpukan mereka. NVIDIA membuka sumber NIXL bersama rangka kerja inferens Dynamo di GTC 2025 . Google secara berterusan telah memperluaskan perisian TPUnya: pertama melalui integrasi vLLM TPU, kemudian melalui rangka kerja inferens teragih asli Kubernetes llm-d, dan kini dengan Raiden .
Inferens terpisah telah menjadi seni bina perkhidmatan standard. Memisahkan peringkat prefill dan decode meningkatkan latensi masa-ke-token-pertama dan penggunaan sumber — tetapi ia menjadikan pemindahan KV-cache yang pantas sebagai kesesakan prestasi kritikal . Kedua-dua Raiden dan NIXL wujud untuk menyelesaikan masalah ini .
Penguncian vendor diperangi di lapisan pergerakan data. NIXL digambarkan sebagai "vendor-agnostik" dan menyokong AWS EFA, bukan hanya interkoneksi NVIDIA sendiri . Raiden juga dipalamkan ke dalam rangka kerja terbuka (vLLM, SGLang, llm-d). Kedua-dua perpustakaan direka untuk menjadikan ekosistem perkakasan masing-masing lebih menarik kepada pembangun daripada memaksa API proprietari .
Ekosistem sedang menumpu pada antara muka KV-connector yang boleh dipalam. API KVConnector vLLM kini menerima penyambung NIXL dan Mooncake, dan seni bina direka untuk menampung mana-mana backend — termasuk Raiden — membolehkan pengendali menukar lapisan pengangkutan tanpa mengubah enjin inferens . Kebolehan palam ini penting untuk persekitaran berbilang pemecut di mana fleksibiliti perkakasan penting.
TPU Raiden menangani cabaran penskalaan asas. Apabila model bahasa besar berkembang, cache KV yang mereka hasilkan semasa inferens menjadi sangat besar — sering melebihi memori on-chip pemecut individu. Menggerakkan data ini antara nod prefill dan decode dengan cekap adalah perbezaan antara sistem inferens yang responsif dan yang terbeban dengan kesesakan pemindahan data .
Dengan membuka sumber Raiden, Google bukan hanya menyamai gerakan NIXL NVIDIA — ia memberi isyarat bahawa inferens berasaskan TPU adalah pesaing serius untuk beban kerja AI pengeluaran. Perpustakaan ini memberikan pengendali TPU alat kelas yang sama yang telah dimiliki oleh pengendali GPU sejak keluaran NIXL: kawalan terperinci ke atas bagaimana data KV-cache bergerak antara pemecut, hierarki memori, dan lapisan storan luaran.
Untuk industri AI yang lebih luas, keluaran Raiden bermakna inferens terpisah pada TPU kini adalah pilihan yang berdaya maju dengan alatan yang betul. Pembangun yang menggunakan perkakasan TPU Google untuk inferens pengeluaran boleh memanfaatkan corak seni bina terpisah yang sama yang telah menjadi standard pada kelompok GPU NVIDIA, tanpa terkurung dalam API pergerakan data proprietari.