Raiden'ın temel yetenekleri üç ana başlıkta toplanabilir:
Örnekler arası KV-önbellek taşıma. Ön yükleme TPU örneklerinden çözümleme TPU örneklerine anahtar-değer tensor'larını aktararak bu aşamaların özel donanımlarda ayrı ayrı çalışmasını sağlar . Bu, NVIDIA NIXL'in GPU tabanlı dağıtımlarda yaptığı temel işle birebir aynıdır .
Dışa aktarma ilkelleri. Raiden, KV-önbellek verilerini TPU belleğinden harici depolama katmanlarına taşımak için gerekli mekanizmaları sunar. NIXL'in NVMe ve RDMA arka uçlarıyla yaptığı hiyerarşik önbellek yönetimine benzer bir yetenek sağlayarak, pahalı yonga üstü belleğin ötesinde etkili bir önbellek kapasitesi oluşturmayı mümkün kılar .
TPU'ya özgü iletim. NVIDIA'nın GPUDirect RDMA yığınından farklı olarak Raiden, Google'ın TPU ara bağlantı dokusu (ICI) üzerinde çalışır ve TPU v5e ve sonraki donanımlar için optimize edilmiştir . Bu, kütüphanenin en baştan Google'ın hızlandırıcı mimarisi için tasarlandığı anlamına geliyor.
| Özellik | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Açık kaynak tarihi | Ağustos 2026 (Apache-2.0) | GTC 2025 (açık kaynak) |
| Hedef donanım | TPU v5e ve sonrası | NVIDIA GPU'ları (Hopper, Blackwell) |
| Temel işlev | Ayrıştırılmış çıkarım için KV-önbellek transferi ve dışa aktarma | Ayrıştırılmış çıkarım için KV-önbellek transferi ve dışa aktarma |
| İletim arka uçları | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Çıkarım motoru entegrasyonu | vLLM TPU eklentisi, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Harici depolamaya aktarım | Ana bilgisayar belleği, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Ekosistem olgunluğu | Erken aşama — yeni açık kaynak yapıldı | Daha olgun — AWS EFA desteği, üretim dağıtımları |
TPU Raiden'ın yayınlanması, çıkarım yazılım yığınının açık kaynaklaştırılması yönündeki hızlanan sektör trendinin bir parçası.
Hiper ölçekleyici (hyperscaler) satıcıların hepsi kendi yığınlarını açık kaynak yapma yarışında. NVIDIA, GTC 2025'te NIXL ve Dynamo çıkarım framework'ünü açık kaynak yapmıştı . Google ise TPU yazılımını adım adım dışa açıyor: önce vLLM TPU entegrasyonu, ardından Kubernetes-native llm-d dağıtılmış çıkarım framework'ü ve şimdi de Raiden .
Ayrıştırılmış çıkarım, standart bir sunum mimarisi haline geldi. Ön yükleme ve çözümleme aşamalarını ayırmak, ilk token'a kadar geçen süreyi (time-to-first-token) iyileştiriyor ve kaynak kullanımını optimize ediyor. Ancak bu, hızlı KV-önbellek transferini kritik bir performans darboğazı haline getiriyor . Hem Raiden hem de NIXL tam olarak bu sorunu çözmek için var .
Satıcıya bağımlılık (vendor lock-in) ile veri taşıma katmanında mücadele ediliyor. NIXL, "satıcıdan bağımsız" olarak tanımlanıyor ve yalnızca NVIDIA'nın kendi ara bağlantılarını değil, AWS EFA'yı da destekliyor . Raiden de benzer şekilde açık framework'lere (vLLM, SGLang, llm-d) bağlanıyor. Her iki kütüphane de kendi donanım ekosistemlerini geliştiriciler için daha cazip hale getirmek ve tescilli API'leri dayatmaktan kaçınmak için tasarlanmış durumda .
Ekosistem, tak-çalıştır (pluggable) KV-bağlayıcı arayüzlerinde birleşiyor. vLLM'in KVConnector API'si artık NIXL ve Mooncake bağlayıcılarını kabul ediyor ve mimari, Raiden dahil her türlü arka ucu destekleyecek şekilde tasarlandı. Bu sayede operatörler, çıkarım motorunu değiştirmeden iletim katmanını değiştirebiliyor . Bu tak-çalıştır özellik, donanım esnekliğinin kritik olduğu çoklu hızlandırıcı ortamları için hayati önem taşıyor.
TPU Raiden, temel bir ölçekleme sorununu ele alıyor. Büyük dil modelleri büyüdükçe, çıkarım sırasında ürettikleri KV-önbelleği de devasa boyutlara ulaşıyor ve çoğu zaman tek bir hızlandırıcının yonga üstü belleğini aşıyor. Bu veriyi ön yükleme ve çözümleme düğümleri arasında verimli bir şekilde taşımak, duyarlı bir çıkarım sistemi ile veri aktarım darboğazlarında boğulan bir sistem arasındaki farkı belirliyor .
Google, Raiden'ı açık kaynak yaparak yalnızca NVIDIA'nın NIXL hamlesine karşılık vermekle kalmıyor, aynı zamanda TPU tabanlı çıkarımın üretim yapay zeka iş yükleri için ciddi bir alternatif olduğu sinyalini veriyor. Kütüphane, TPU operatörlerine GPU operatörlerinin NIXL'den bu yana sahip olduğu araçların aynısını sunuyor: KV-önbellek verilerinin hızlandırıcılar, bellek hiyerarşileri ve harici depolama katmanları arasında nasıl hareket edeceği üzerinde ince ayar yapma kontrolü.
Daha geniş yapay zeka endüstrisi için Raiden'ın yayınlanması, TPU'lar üzerinde ayrıştırılmış çıkarımın artık uygun araçlarla uygulanabilir bir seçenek olduğu anlamına geliyor. Google'ın TPU donanımını üretim çıkarımı için kullanan geliştiriciler, NVIDIA GPU kümelerinde standart haline gelen ayrıştırılmış mimari desenlerinden yararlanabilirken, tescilli veri taşıma API'lerine kilitlenmekten kurtuluyor.
Google'ın TPU Raiden'ı açık kaynak yapması, yapay zeka çıkarım altyapısı savaşlarının artık sadece donanım düzeyinde değil, onu besleyen yazılım yığını düzeyinde de yaşandığını gösteriyor. Raiden, NVIDIA'nın NIXL'ine karşı TPU cephesinde kritik bir eksikliği giderirken, aynı zamanda Google'ın TPU ekosistemini daha açık, esnek ve geliştirici dostu hale getirme stratejisinin de önemli bir parçası. Önümüzdeki dönemde bu iki kütüphane arasındaki rekabetin, büyük dil modellerinin daha verimli ve ölçeklenebilir bir şekilde sunulmasını sağlaması bekleniyor.