Основні можливості Raiden поділяються на три ключові категорії:
Міжвузлова передача KV-кешу. Бібліотека передає тензори ключ-значення від префіл-інстансів TPU до декод-інстансів у дезагрегованій архітектурі, дозволяючи розділити ці фази на виділене обладнання . Це та сама фундаментальна задача, яку виконує NVIDIA NIXL у розгортаннях на графічних процесорах .
Примітиви вивантаження. Raiden надає механізми для переміщення даних KV-кешу з пам'яті TPU на зовнішні рівні зберігання, підтримуючи ієрархічне керування кешем, аналогічне тому, що NIXL робить за допомогою NVMe та RDMA бекендів . Це важливо для розширення ефективної ємності кешу за межі дорогої внутрішньої пам'яті.
Рідний транспорт для TPU. На відміну від стеку GPUDirect RDMA від NVIDIA, Raiden працює через власну мережу з'єднань TPU (ICI) та оптимізований для TPU v5e і новіших версій обладнання . Це означає, що він розроблений з нуля саме для архітектури прискорювачів Google, а не адаптований з підходу, орієнтованого на GPU.
Наведена таблиця підсумовує, як дві бібліотеки порівнюються за ключовими параметрами:
| Особливість | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Дата відкриття коду | Серпень 2026 (Apache-2.0) | GTC 2025 (відкритий код) |
| Цільове обладнання | TPU v5e та новіші | Графічні процесори NVIDIA (Hopper, Blackwell) |
| Основна функція | Передача та вивантаження KV-кешу для дезагрегованого інференсу | Передача та вивантаження KV-кешу для дезагрегованого інференсу |
| Транспортні бекенди | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Інтеграція з рушіями інференсу | Плагін vLLM для TPU, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Вивантаження на зовнішнє сховище | Пам'ять хоста, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Зрілість екосистеми | Рання — щойно відкрито код | Більш зріла — підтримка AWS EFA, продакшн-розгортання |
Випуск TPU Raiden є частиною чіткої та прискореної галузевої тенденції до відкриття програмного стеку для інференсу.
Обидва гіперскейлери змагаються у відкритті своїх стеків. NVIDIA відкрила NIXL разом із фреймворком Dynamo на GTC 2025 . Google поступово екстерналізує своє програмне забезпечення для TPU: спочатку через інтеграцію vLLM TPU, потім через Kubernetes-рідний фреймворк llm-d, а тепер і з Raiden .
Дезагрегований інференс став стандартною архітектурою. Розділення фаз префілу та декодування покращує затримку до першого токену та використання ресурсів — але це робить швидку передачу KV-кешу критичним вузьким місцем продуктивності . І Raiden, і NIXL існують саме для вирішення цієї проблеми .
Боротьба за прив'язку до вендора ведеться на рівні переміщення даних. NIXL описується як "вендорно-нейтральний" і підтримує AWS EFA, а не лише власні з'єднання NVIDIA . Raiden також підключається до відкритих фреймворків (vLLM, SGLang, llm-d). Обидві бібліотеки розроблені, щоб зробити свої екосистеми обладнання більш привабливими для розробників, а не нав'язувати пропрієтарні API .
Екосистема сходиться на плагінних інтерфейсах KV-з'єднань. API KVConnector у vLLM тепер приймає NIXL та Mooncake конектори, а архітектура розрахована на підтримку будь-якого бекенду — включно з Raiden — що дозволяє операторам змінювати транспортний рівень без зміни рушія інференсу . Ця модульність є критично важливою для середовищ з різнотипними прискорювачами, де гнучкість обладнання має значення.
TPU Raiden вирішує фундаментальну проблему масштабування. Зі зростанням великих мовних моделей KV-кеш, який вони створюють під час інференсу, стає величезним — часто перевищуючи обсяг внутрішньої пам'яті окремих прискорювачів. Ефективне переміщення цих даних між вузлами префілу та декодування є вирішальним фактором між чуйною системою інференсу та системою, що завантажена вузькими місцями передачі даних .
Відкриваючи код Raiden, Google не просто копіює хід NVIDIA з NIXL — він сигналізує, що інференс на TPU є серйозним претендентом для продуктивних ШІ-навантажень. Бібліотека надає операторам TPU той самий клас інструментів, який оператори GPU мають з моменту випуску NIXL: тонкий контроль над тим, як дані KV-кешу переміщуються між прискорювачами, ієрархіями пам'яті та зовнішніми рівнями зберігання.
Для ширшої ШІ-індустрії випуск Raiden означає, що дезагрегований інференс на TPU тепер є життєздатним варіантом із належним інструментарієм. Розробники, які використовують обладнання TPU від Google для продакшн-інференсу, можуть застосовувати ті самі патерни дезагрегованої архітектури, які стали стандартом на кластерах NVIDIA GPU, без прив'язки до пропрієтарних API для переміщення даних.