Основные возможности Raiden делятся на три категории:
Перемещение KV-кэша между экземплярами. Он передает тензоры key-value от prefill-экземпляров TPU к decode-экземплярам в дезагрегированной архитектуре, что позволяет разделить эти фазы на выделенное оборудование . Это та же фундаментальная задача, которую выполняет NVIDIA NIXL в конфигурациях на базе GPU .
Примитивы выгрузки. Raiden предоставляет базовые механизмы для перемещения данных KV-кэша из памяти TPU на внешние уровни хранения, поддерживая иерархическое управление кэшем, аналогично тому, что делает NIXL с бэкендами NVMe и RDMA . Это необходимо для расширения эффективной емкости кэша за пределы дорогой встроенной памяти.
Транспорт, оптимизированный для TPU. В отличие от стека GPUDirect RDMA от NVIDIA, Raiden работает через собственную сетку Google TPU (ICI) и оптимизирован для TPU v5e и более новых устройств . Это означает, что он изначально спроектирован для архитектуры ускорителей Google, а не адаптирован из подхода, ориентированного на GPU.
В следующей таблице сравниваются две библиотеки по ключевым параметрам:
| Характеристика | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Дата открытия исходного кода | Август 2026 (Apache-2.0) | GTC 2025 (открытый исходный код) |
| Целевое оборудование | TPU v5e и новее | NVIDIA GPU (Hopper, Blackwell) |
| Основная функция | Передача + выгрузка KV-кэша для дезагрегированного инференса | Передача + выгрузка KV-кэша для дезагрегированного инференса |
| Транспортные бэкенды | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Интеграция с движками инференса | vLLM TPU plugin, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Выгрузка во внешнее хранилище | Память хоста, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Зрелость экосистемы | Ранняя — недавно открыт исходный код | Более зрелая — поддержка AWS EFA, промышленные развертывания |
Выпуск TPU Raiden является частью четкого и ускоряющегося отраслевого сдвига в сторону открытия стека программного обеспечения для инференса.
Оба гиперскейлера гонятся за открытием своих стеков. NVIDIA открыла исходный код NIXL вместе с фреймворком Dynamo на GTC 2025 . Google последовательно экстернализирует свое программное обеспечение для TPU: сначала через интеграцию vLLM TPU, затем через фреймворк llm-d для распределенного инференса на Kubernetes и, наконец, с Raiden .
Дезагрегированный инференс стал стандартной архитектурой обслуживания. Разделение этапов prefill и decode улучшает задержку первого токена и использование ресурсов, но делает быструю передачу KV-кэша критическим узким местом производительности . И Raiden, и NIXL существуют для решения именно этой проблемы .
Борьба с привязкой к вендору идет на уровне перемещения данных. NIXL описывается как «независимый от вендора» и поддерживает AWS EFA, а не только собственные сети NVIDIA . Raiden аналогичным образом подключается к открытым фреймворкам (vLLM, SGLang, llm-d). Обе библиотеки созданы, чтобы сделать свои аппаратные экосистемы более привлекательными для разработчиков, а не навязывать проприетарные API .
Экосистема сходится на подключаемых интерфейсах KV-коннекторов. API KVConnector vLLM теперь поддерживает коннекторы NIXL и Mooncake, а архитектура спроектирована для работы с любым бэкендом, включая Raiden, что позволяет операторам менять транспортный уровень без изменения движка инференса . Эта подключаемость критически важна для сред с несколькими типами ускорителей, где важна гибкость оборудования.
TPU Raiden решает фундаментальную проблему масштабирования. По мере роста больших языковых моделей KV-кэш, который они создают во время инференса, становится огромным — часто превышая объем встроенной памяти отдельных ускорителей. Эффективное перемещение этих данных между узлами prefill и decode — это разница между отзывчивой системой инференса и системой, тормозящей из-за узких мест передачи данных .
Открывая исходный код Raiden, Google не просто повторяет ход NVIDIA с NIXL — он сигнализирует, что инференс на TPU является серьезным кандидатом для промышленных ИИ-нагрузок. Библиотека дает операторам TPU тот же класс инструментов, который у операторов GPU появился с выходом NIXL: тонкий контроль над тем, как данные KV-кэша перемещаются между ускорителями, иерархиями памяти и внешними уровнями хранения.
Для всей ИИ-индустрии выпуск Raiden означает, что дезагрегированный инференс на TPU теперь является жизнеспособным вариантом с правильным инструментарием. Разработчики, использующие оборудование Google TPU для промышленного инференса, могут применять те же шаблоны дезагрегированной архитектуры, которые стали стандартом в кластерах NVIDIA GPU, не будучи привязанными к проприетарным API для перемещения данных.