오프로딩 기본 기능. Raiden은 KV-캐시 데이터를 TPU 메모리에서 외부 스토리지 계층으로 이동시키는 기본 메커니즘을 제공하며, 이는 NIXL이 NVMe 및 RDMA 백엔드에서 수행하는 계층형 캐시 관리와 유사합니다 소. 이는 비싼 온칩 메모리의 한계를 넘어 효과적인 캐시 용량을 확장하는 데 필수적입니다.
TPU 네이티브 전송. 엔비디아의 GPUDirect RDMA 스택과 달리, Raiden은 구글의 TPU 인터커넥트 패브릭(ICI) 위에서 작동하며, TPU v5e 이상의 하드웨어에 최적화되어 있습니다 . 즉, GPU 중심 접근 방식을 변환한 것이 아니라 처음부터 구글의 가속기 아키텍처를 위해 설계되었습니다.
다음 표는 두 라이브러리의 주요 차이점을 보여줍니다.
| 특징 | TPU Raiden (구글) | NIXL (엔비디아) |
|---|---|---|
| 오픈소스 공개일 | 2026년 8월 (아파치 2.0) | 2025년 GTC (오픈소스) |
| 대상 하드웨어 | TPU v5e 이상 | 엔비디아 GPU (Hopper, Blackwell) |
| 핵심 기능 | 분리형 추론을 위한 KV-캐시 전송 + 오프로딩 | 분리형 추론을 위한 KV-캐시 전송 + 오프로딩 |
| 전송 백엔드 | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| 추론 엔진 통합 | vLLM TPU 플러그인, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| 외부 스토리지 오프로드 | 호스트 메모리, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| 생태계 성숙도 | 초기 단계 — 최근 오픈소스화 | 비교적 성숙 — AWS EFA 지원, 프로덕션 환경 사용 |
TPU Raiden의 공개는 추론 소프트웨어 스택을 오픈소스화하는 뚜렷하고 가속화되는 업계 움직임의 일부입니다.
하이퍼스케일러 업체들이 자사 스택을 오픈소스화하기 위해 경쟁 중입니다. 엔비디아는 2025년 GTC에서 Dynamo 추론 프레임워크와 함께 NIXL을 오픈소스로 공개했습니다 . 구글은 TPU 소프트웨어를 꾸준히 외부에 공개해 왔습니다. 처음에는 vLLM TPU 통합, 그다음에는 쿠버네티스 네이티브 분산 추론 프레임워크인 llm-d, 그리고 이제 Raiden까지
.
분리형 추론은 표준 서빙 아키텍처가 되었습니다. 프리필과 디코드 단계를 분리하면 첫 번째 토큰까지의 지연 시간(TTFT)과 리소스 활용도가 개선되지만, 이로 인해 빠른 KV-캐시 전송이 핵심적인 성능 병목 지점이 됩니다 . Raiden과 NIXL 모두 정확히 이 문제를 해결하기 위해 존재합니다
.
벤더 종속은 데이터 이동 계층에서 싸우고 있습니다. NIXL은 '벤더에 구애받지 않는(vendor-agnostic)' 라이브러리로 설명되며, 엔비디아 자체 인터커넥트뿐만 아니라 AWS EFA도 지원합니다 . Raiden도 마찬가지로 vLLM, SGLang, llm-d와 같은 오픈 프레임워크에 연결됩니다. 두 라이브러리 모두 독점 API를 강요하기보다는 각각의 하드웨어 생태계를 개발자에게 더 매력적으로 만들기 위해 설계되었습니다
소.
생태계는 플러그형 KV-커넥터 인터페이스로 수렴되고 있습니다. vLLM의 KVConnector API는 이제 NIXL과 Mooncake 커넥터를 지원하며, 추론 엔진을 변경하지 않고도 전송 계층을 교체할 수 있도록 설계되었습니다 . 이러한 플러그형 특성은 하드웨어 유연성이 중요한 다중 가속기 환경에서 매우 중요합니다.
TPU Raiden은 근본적인 확장 과제를 해결합니다. 대규모 언어 모델이 성장함에 따라 추론 중에 생성되는 KV 캐시는 방대해져서 개별 가속기의 온칩 메모리를 초과하는 경우가 많습니다. 프리필 노드와 디코드 노드 간에 이 데이터를 효율적으로 이동하는 것이 응답성이 좋은 추론 시스템과 데이터 전송 병목 현상에 발목 잡힌 시스템을 가르는 기준입니다 소.
Raiden을 오픈소스화함으로써 구글은 단순히 엔비디아의 NIXL 전략을 따라잡는 것이 아닙니다. TPU 기반 추론이 프로덕션 AI 워크로드에서 진지한 경쟁자임을 알리는 신호입니다. 이 라이브러리는 TPU 운영자에게 GPU 운영자가 NIXL 출시 이후 가질 수 있었던 것과 동일한 종류의 도구, 즉 KV-캐시 데이터가 가속기, 메모리 계층 구조, 외부 스토리지 계층 간에 어떻게 이동하는지에 대한 세밀한 제어권을 제공합니다.
더 넓은 AI 업계의 관점에서 Raiden의 공개는 이제 TPU에서의 분리형 추론이 적절한 도구를 갖춘 실행 가능한 옵션이 되었음을 의미합니다. TPU 하드웨어를 프로덕션 추론에 배포하는 개발자는 엔비디아 GPU 클러스터에서 표준이 된 분리형 아키텍처 패턴을 동일하게 활용할 수 있으며, 독점 데이터 이동 API에 묶일 필요가 없습니다.