TPU Raiden giải quyết điểm nghẽn then chốt trong các kiến trúc suy luận phân tán hiện đại: di chuyển các tensor KV-cache giữa các worker prefill và decode một cách nhanh chóng, giúp luồng suy luận hoạt động trơn tru và hiệu quả .
Các khả năng cốt lõi của Raiden được chia thành ba nhóm chính:
Truyền KV-cache giữa các instance (Inter-instance KV-cache movement). Nó truyền các tensor key-value từ instance prefill sang instance decode trong kiến trúc suy luận phân tách. Đây cũng chính là nhiệm vụ cốt lõi của NVIDIA NIXL trong các hệ thống sử dụng GPU .
Các công cụ offloading (Offloading primitives). Raiden cung cấp cơ chế để di chuyển dữ liệu KV-cache ra khỏi bộ nhớ TPU tới các tầng lưu trữ ngoài (như bộ nhớ máy chủ, Google Cloud Lustre), hỗ trợ quản lý bộ nhớ cache phân cấp - tương tự cách NIXL sử dụng các backend NVMe và RDMA . Điều này rất quan trọng để mở rộng dung lượng cache hiệu quả, vượt qua giới hạn bộ nhớ on-chip đắt đỏ.
Cơ chế truyền tải bản địa của TPU (TPU-native transport). Không giống như GPUDirect RDMA của NVIDIA, Raiden hoạt động trên kết nối nội bộ ICI (TPU Interconnect Fabric) của Google và được tối ưu hóa cho TPU v5e và các thế hệ mới hơn. Điều này có nghĩa là nó không phải phiên bản chuyển thể từ cách tiếp cận của GPU, mà được thiết kế ngay từ đầu cho kiến trúc tăng tốc của Google .
Bảng dưới đây tóm tắt sự khác biệt chính giữa hai thư viện:
| Tính năng | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Ngày phát hành | Tháng 8, 2026 (Apache-2.0) | GTC 2025 (mã nguồn mở) |
| Phần cứng mục tiêu | TPU v5e trở lên | GPU NVIDIA (Hopper, Blackwell) |
| Chức năng chính | Truyền, offloading KV-cache cho suy luận phân tách | Truyền, offloading KV-cache cho suy luận phân tách |
| Các backend vận chuyển | ICI của TPU, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Tích hợp engine suy luận | Plugin vLLM TPU, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Offloading lưu trữ ngoài | Bộ nhớ máy chủ, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Mức độ hoàn thiện | Sớm — mới được mở nguồn | Hoàn thiện hơn — hỗ trợ AWS EFA, triển khai sản xuất |
Việc phát hành TPU Raiden không phải là một sự kiện riêng lẻ, mà là một phần trong xu hướng mở nguồn hóa toàn bộ ngăn xếp phần mềm suy luận (inference stack).
Cả hai 'gã khổng lồ' đều đang chạy đua mở nguồn. NVIDIA đã mở nguồn NIXL cùng với framework suy luận Dynamo tại GTC 2025 . Google, ngược lại, đang từng bước mở rộng hệ sinh thái phần mềm cho TPU: tích hợp TPU vào vLLM, phát triển framework suy luận phân tán llm-d (Kubernetes-native), và bây giờ là Raiden .
Suy luận phân tách đã trở thành kiến trúc tiêu chuẩn. Việc tách biệt giai đoạn prefill (xử lý ngữ cảnh) và decode (sinh token) giúp giảm độ trễ 'time-to-first-token' và tối ưu tài nguyên, nhưng nó cũng biến việc truyền KV-cache thành nút thắt hiệu suất quan trọng nhất . Cả Raiden và NIXL đều ra đời để giải quyết bài toán này .
Trận chiến 'khóa cứng' (vendor lock-in) đang diễn ra ở lớp di chuyển dữ liệu. NVIDIA khẳng định NIXL là "không phụ thuộc nhà cung cấp" (vendor-agnostic) và hỗ trợ AWS EFA, không chỉ sử dụng kết nối nội bộ của riêng họ . Tương tự, Raiden có thể được 'cắm' vào các framework mở như vLLM, SGLang và llm-d . Cả hai thư viện đều được thiết kế để làm cho hệ sinh thái phần cứng tương ứng của họ trở nên hấp dẫn hơn đối với các nhà phát triển, thay vì ép họ dùng các API độc quyền.
Hệ sinh thái đang hội tụ về một chuẩn giao diện 'KV-connector' linh hoạt. API KVConnector của vLLM hiện đã hỗ trợ các 'kết nối' (connector) NIXL và Mooncake . Với kiến trúc này, các nhà vận hành có thể dễ dàng thay đổi lớp truyền tải (transport layer) mà không cần sửa đổi engine suy luận, tạo sự linh hoạt tối đa, đặc biệt trong các môi trường đa loại tăng tốc (multi-accelerator).
TPU Raiden giải quyết một thách thức mở rộng cơ bản. Khi các mô hình ngôn ngữ lớn (LLM) ngày càng phát triển, KV cache mà chúng tạo ra trong quá trình suy luận trở nên khổng lồ, thường vượt quá bộ nhớ on-chip của các bộ tăng tốc riêng lẻ. Di chuyển dữ liệu này một cách hiệu quả giữa các node prefill và decode là yếu tố quyết định tạo nên một hệ thống suy luận phản hồi nhanh, thay vì một hệ thống bị kìm hãm bởi các nút thắt trong truyền dữ liệu .
Bằng cách mở nguồn Raiden, Google không chỉ bắt chước chiến thuật NIXL của NVIDIA. Họ đang gửi một tín hiệu mạnh mẽ rằng suy luận trên nền tảng TPU là một ứng cử viên nghiêm túc cho các khối lượng công việc AI sản xuất. Với Raiden, các nhà vận hành TPU có trong tay những công cụ tương tự mà các nhà vận hành GPU đã có từ khi NIXL ra mắt: quyền kiểm soát chi tiết cách dữ liệu KV-cache di chuyển giữa các bộ tăng tốc, các cấp bậc bộ nhớ và tầng lưu trữ ngoài.
Đối với ngành công nghiệp AI rộng lớn hơn, việc phát hành Raiden có nghĩa là suy luận phân tách trên TPU giờ đây là một lựa chọn khả thi với đầy đủ công cụ hỗ trợ. Các nhà phát triển sử dụng TPU của Google cho suy luận sản xuất có thể tận dụng các mẫu kiến trúc phân tách tương tự đã trở thành tiêu chuẩn trên các cụm GPU NVIDIA, mà không bị 'khóa cứng' vào các API di chuyển dữ liệu độc quyền.