Základní funkce Raiden se dělí do tří hlavních oblastí:
Přesun KV-cache mezi instancemi. Přesouvá tenzory key-value z prefill TPU instancí na decode TPU instance v disagregované architektuře, což umožňuje oddělení těchto fází na dedikovaný hardware . To je stejný základní úkol, který plní NVIDIA NIXL v nasazeních na GPU .
Primitiva pro offloading. Raiden poskytuje mechanismy pro přesun dat KV-cache z paměti TPU na externí úložné vrstvy, čímž podporuje hierarchické řízení cache podobně jako NIXL s back-endy NVMe a RDMA . To je klíčové pro rozšíření efektivní kapacity cache nad rámec drahé čipové paměti.
Transport přizpůsobený TPU. Na rozdíl od NVIDIA GPUDirect RDMA stacku pracuje Raiden přes Google TPU ICI (interconnect fabric) a je optimalizován pro TPU v5e a novější hardware . Je tedy navržen od základů pro architekturu Google akcelerátoru, nikoli adaptován z přístupu zaměřeného na GPU.
Následující tabulka shrnuje srovnání obou knihoven v klíčových dimenzích:
| Funkce | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Datum otevření zdrojových kódů | Srpen 2026 (Apache-2.0) | GTC 2025 (open source) |
| Cílový hardware | TPU v5e a novější | NVIDIA GPU (Hopper, Blackwell) |
| Hlavní funkce | Přenos + offloading KV-cache pro disagregované inferencování | Přenos + offloading KV-cache pro disagregované inferencování |
| Transportní back-endy | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Integrace s inferenčními enginy | vLLM TPU plugin, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Offload na externí úložiště | Hostitelská paměť, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Vyspělost ekosystému | Raná – nedávno otevřeno | Vyspělejší – podpora AWS EFA, produkční nasazení |
Vydání TPU Raiden je součástí jasného a zrychlujícího se průmyslového trendu směrem k otevření softwarového stacku pro inferenci.
Oba hyperscaleroví dodavatelé závodí v otevírání svých stacků. NVIDIA otevřela NIXL společně s inferenčním frameworkem Dynamo na GTC 2025 . Google postupně externalizuje svůj TPU software: nejprve integrací vLLM TPU, poté Kubernetes-native frameworkem llm-d pro distribuované inferencování a nyní s Raiden .
Disagregované inferencování se stalo standardní architekturou. Oddělení prefill a decode fáze zlepšuje latenci prvního tokenu (TTFT) a využití zdrojů – ale činí z rychlého přenosu KV-cache kritické výkonnostní úzké hrdlo . Jak Raiden, tak NIXL existují právě pro vyřešení tohoto problému .
O vendor lock-in se bojuje na vrstvě přesunu dat. NIXL je popisován jako „vendor-agnostic“ a podporuje AWS EFA, nejen vlastní propojení NVIDIA . Raiden se podobně zapojuje do otevřených frameworků (vLLM, SGLang, llm-d). Obě knihovny jsou navrženy tak, aby učinily své hardwarové ekosystémy atraktivnějšími pro vývojáře, místo aby vynucovaly proprietární API .
Ekosystém konverguje k rozhraní pluggable KV-konektorů. API KVConnector vLLM nyní přijímá konektory NIXL a Mooncake a architektura je navržena tak, aby pojala jakýkoli back-end – včetně Raiden – což operátorům umožňuje vyměnit transportní vrstvu bez změny inferenčního enginu . Tato zásuvná modularita je klíčová pro multi-akcelerátorová prostředí, kde záleží na flexibilitě hardwaru.
TPU Raiden řeší zásadní škálovací výzvu. Jak velké jazykové modely rostou, KV cache, kterou při inferenci vytvářejí, se stává obrovskou – často přesahuje čipovou paměť jednotlivých akcelerátorů. Efektivní přesun těchto dat mezi prefill a decode uzly je rozdílem mezi responzivním inferenčním systémem a systémem zpomaleným úzkými hrdly přenosu dat .
Otevřením Raiden Google nejen kopíruje tah NVIDIA s NIXL – signalizuje tím, že inference na TPU je seriózním hráčem pro produkční AI zátěže. Knihovna dává operátorům TPU stejnou třídu nástrojů, jakou mají operátoři GPU od vydání NIXL: jemnozrnnou kontrolu nad tím, jak se data KV-cache pohybují mezi akcelerátory, paměťovými hierarchiemi a externími úložnými vrstvami.
Pro širší AI průmysl znamená vydání Raiden, že disagregované inferencování na TPU je nyní životaschopnou volbou se správnými nástroji. Vývojáři nasazující Google TPU hardware pro produkční inferenci mohou využít stejné vzory disagregované architektury, které se staly standardem na GPU klastrech NVIDIA – aniž by byli uzamčeni do proprietárních API pro přesun dat.