A funcionalidade principal do Raiden se divide em três capacidades:
Movimentação de KV-cache entre instâncias. Ele transfere tensores chave-valor de instâncias TPU de preenchimento para instâncias TPU de decodificação em uma arquitetura de servidor desagregada, permitindo a separação dessas fases em hardware dedicado . Esta é a mesma função fundamental que a NIXL da NVIDIA executa em implantações baseadas em GPU .
Primitivas de descarregamento (offloading). O Raiden fornece os mecanismos subjacentes para mover dados de KV-cache da memória da TPU para camadas de armazenamento externo, suportando gerenciamento hierárquico de cache, similar ao que a NIXL faz com backends NVMe e RDMA . Isso é essencial para estender a capacidade efetiva de cache além da cara memória no chip.
Transporte nativo para TPU. Diferentemente da pilha GPUDirect RDMA da NVIDIA, o Raiden opera sobre o barramento de interconexão de TPUs (ICI) do Google e é otimizado para TPU v5e e hardware mais novo . Isso significa que ele foi projetado desde o início para a arquitetura de aceleradores do Google, em vez de ser adaptado de uma abordagem centrada em GPU.
A tabela a seguir resume como as duas bibliotecas se comparam em dimensões-chave:
| Funcionalidade | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Data de lançamento open-source | Agosto de 2026 (Apache-2.0) | GTC 2025 (código aberto) |
| Hardware alvo | TPU v5e e posteriores | GPUs NVIDIA (Hopper, Blackwell) |
| Função principal | Transferência + descarregamento de KV-cache para inferência desagregada | Transferência + descarregamento de KV-cache para inferência desagregada |
| Backends de transporte | ICI da TPU, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Integração com motores de inferência | Plugin vLLM TPU, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Descarregamento para armazenamento externo | Memória do host, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Maturidade do ecossistema | Inicial — recentemente aberto | Mais maduro — suporte a AWS EFA, implantações em produção |
O lançamento do TPU Raiden faz parte de uma mudança clara e acelerada na indústria em direção à abertura do código da pilha de software de inferência.
Ambos os hyperscalers estão correndo para abrir suas pilhas. A NVIDIA abriu o código da NIXL juntamente com o framework de inferência Dynamo no GTC 2025 . O Google vem externalizando seu software para TPU de forma constante: primeiro com a integração vLLM TPU, depois com o framework de inferência distribuída llm-d (nativo do Kubernetes) e agora com o Raiden .
A inferência desagregada tornou-se a arquitetura de servidor padrão. Separar os estágios de preenchimento e decodificação melhora a latência do primeiro token (time-to-first-token) e a utilização de recursos — mas torna a transferência rápida de KV-cache o gargalo crítico de desempenho . Tanto o Raiden quanto a NIXL existem para resolver exatamente esse problema .
O vendor lock-in está sendo combatido na camada de movimentação de dados. A NIXL é descrita como "agnóstica de fornecedor" e suporta AWS EFA, não apenas as próprias interconexões da NVIDIA . O Raiden, de forma similar, se conecta a frameworks abertos (vLLM, SGLang, llm-d). Ambas as bibliotecas são projetadas para tornar seus respectivos ecossistemas de hardware mais atraentes para desenvolvedores, em vez de forçar APIs proprietárias .
O ecossistema está convergindo para interfaces de conector KV plugáveis. A API KVConnector do vLLM agora aceita conectores NIXL e Mooncake, e a arquitetura é projetada para acomodar qualquer backend — incluindo o Raiden — permitindo que operadores troquem a camada de transporte sem alterar o motor de inferência . Essa capacidade de plug-and-play é crítica para ambientes multi-aceleradores onde a flexibilidade de hardware é importante.
O TPU Raiden aborda um desafio fundamental de escalabilidade. À medida que os modelos de linguagem de grande porte (LLMs) crescem, o cache KV que eles produzem durante a inferência torna-se enorme — frequentemente excedendo a memória no chip de aceleradores individuais. Mover esses dados entre nós de preenchimento e decodificação de forma eficiente é a diferença entre um sistema de inferência responsivo e um sobrecarregado por gargalos de transferência de dados .
Ao abrir o código do Raiden, o Google não está apenas igualando a jogada da NIXL da NVIDIA — ele está sinalizando que a inferência baseada em TPU é uma concorrente séria para cargas de trabalho de IA em produção. A biblioteca dá aos operadores de TPU o mesmo tipo de ferramentas que os operadores de GPU têm desde o lançamento da NIXL: controle refinado sobre como os dados de KV-cache se movem entre aceleradores, hierarquias de memória e camadas de armazenamento externo.
Para o setor de IA como um todo, o lançamento do Raiden significa que a inferência desagregada em TPUs é agora uma opção viável com as ferramentas adequadas. Desenvolvedores que utilizam hardware TPU do Google para inferência em produção podem aproveitar os mesmos padrões de arquitetura desagregada que se tornaram padrão em clusters de GPU NVIDIA, sem ficarem presos a APIs proprietárias de movimentação de dados.