Raidenin ydintoiminnot jakautuvat kolmeen pääasialliseen kyvykkyyteen:
Instanssien välinen KV-välimuistin siirto. Se siirtää avain-arvo-tensoreita prefill-TPU-instansseilta decode-TPU-instansseille hajautetussa palveluarkkitehtuurissa, mahdollistaen näiden vaiheiden erottamisen omille laitteistoilleen . Tämä on sama perustehtävä, jonka NVIDIA NIXL suorittaa GPU-pohjaisissa asennuksissa .
Siirtoprimitiivit. Raiden tarjoaa mekanismeja KV-välimuistitietojen siirtämiseen TPU-muistista ulkoisiin tallennusratkaisuihin, tukien hierarkkista välimuistinhallintaa, joka on samankaltainen kuin NIXL tekee NVMe- ja RDMA-taustaosilla . Tämä on välttämätöntä tehokkaan välimuistin kapasiteetin laajentamiseksi kalliin sirulla olevan muistin ulkopuolelle.
TPU-natiivi tiedonsiirto. Toisin kuin NVIDIA GPUDirect RDMA -pino, Raiden toimii Googlen TPU-liitäntäverkon (ICI) kautta ja on optimoitu TPU v5e -siruille ja sitä uudemmille laitteistoille . Se on suunniteltu alusta alkaen Googlen kiihdytinarkkitehtuurille, eikä sitä ole sovitettu GPU-keskeisestä lähestymistavasta.
Seuraava taulukko tiivistää, miten kirjastot vertautuvat toisiinsa keskeisillä osa-alueilla:
| Ominaisuus | TPU Raiden (Google) | NIXL (NVIDIA) |
|---|---|---|
| Avoimen lähdekoodin päiväys | Elokuu 2026 (Apache-2.0) | GTC 2025 (avoin lähdekoodi) |
| Kohdelaitteisto | TPU v5e ja uudemmat | NVIDIA GPU:t (Hopper, Blackwell) |
| Ydintoiminto | KV-välimuistin siirto ja siirto ulkoiseen tallennustilaan hajautetussa päättelyssä | KV-välimuistin siirto ja siirto ulkoiseen tallennustilaan hajautetussa päättelyssä |
| Tiedonsiirron taustaosat | TPU ICI, DCN TCP | NVLink, InfiniBand RDMA, RoCE, TCP, NVMe-oF, S3 |
| Päättelymoottorin integrointi | vLLM TPU -liitännäinen, llm-d, SGLang | vLLM (NixlConnector), TensorRT-LLM, SGLang, Dynamo |
| Ulkoinen tallennussiirto | Isäntämuisti, Google Cloud Lustre | NVMe-oF, S3, DDN Infinia |
| Ekosysteemin kypsyys | Varhainen – vasta avattu lähdekoodiksi | Kypsempi – AWS EFA -tuki, tuotantokäytöt |
TPU Raidenin julkaisu on osa selkeää ja kiihtyvää teollisuudenalan siirtymää kohti päättelyohjelmistopinojen avaamista lähdekoodiksi.
Molemmat hyperskaalaajatoimittajat kilpailevat avoimen lähdekoodin pinojen julkaisemisesta. NVIDIA avasi NIXL:n lähdekoodiksi yhdessä Dynamo-päättelykehyksen kanssa GTC 2025 -tapahtumassa . Google on johdonmukaisesti ulkoistanut TPU-ohjelmistoaan: ensin vLLM TPU -integroinnin, sitten Kubernetes-natiivin llm-d-hajautetun päättelykehyksen ja nyt Raidenin .
Hajautetusta päättelystä on tullut standardi palveluarkkitehtuuri. Prefill- ja decode-vaiheiden erottaminen parantaa ensimmäisen tokenin viivettä ja resurssien käyttöastetta – mutta se tekee nopeasta KV-välimuistin siirrosta kriittisen suorituskyvyn pullonkaulan . Sekä Raiden että NIXL on luotu ratkaisemaan juuri tämä ongelma .
Toimittajariippuvuutta torjutaan tiedonsiirtokerroksessa. NIXL:ää kuvataan "toimittajariippumattomaksi", ja se tukee AWS EFA:ta, ei vain NVIDIA omia liitäntöjä . Raiden puolestaan liittyy avoimiin kehyksiin (vLLM, SGLang, llm-d). Molemmat kirjastot on suunniteltu tekemään omista laitteistoekosysteemeistään houkuttelevampia kehittäjille sen sijaan, että ne pakottaisivat omat rajapintansa .
Ekosysteemi on konvergoitumassa liitettävien KV-liitäntöjen suuntaan. vLLM:n KVConnector-rajapinta hyväksyy nyt NIXL- ja Mooncake-liittimet, ja arkkitehtuuri on suunniteltu tukemaan mitä tahansa taustajärjestelmää – mukaan lukien Raiden – mikä mahdollistaa operaattoreiden vaihtaa tiedonsiirtokerrosta ilman, että päättelymoottoria tarvitsee muuttaa . Tämä liitettävyys on kriittistä monikiihdytinympäristöissä, joissa laitteiston joustavuus on tärkeää.
TPU Raiden vastaa perustavaanlaatuiseen skaalaushaasteeseen. Kun suuret kielimallit kasvavat, niiden päättelyn aikana tuottama KV-välimuisti valtava – se ylittää usein yksittäisten kiihdyttimien sirulla olevan muistin. Tämän tiedon siirtäminen tehokkaasti prefill- ja decode-solmujen välillä on ero responsiivisen päättelyjärjestelmän ja sellaisen välillä, joka jumittuu tiedonsiirron pullonkauloihin .
Avaamalla Raidenin lähdekoodiksi Google ei ainoastaan vastaa NVIDIA NIXL-peliliikkeeseen – se viestii, että TPU-pohjainen päättely on vakavasti otettava vaihtoehto tuotantotason tekoälytyökuormille. Kirjasto antaa TPU-operaattoreille samanlaiset työkalut, jotka GPU-operaattoreilla on ollut NIXL:n julkaisusta lähtien: hienojakoinen hallinta siitä, miten KV-välimuistitieto liikkuu kiihdyttimien, muistihierarkioiden ja ulkoisten tallennustasojen välillä.
Laajemmalle tekoälyteollisuudelle Raidenin julkaisu tarkoittaa, että hajautettu päättely TPUilla on nyt elinkelpoinen vaihtoehto asianmukaisilla työkaluilla. Kehittäjät, jotka käyttävät Googlen TPU-laitteistoa tuotantopäättelyssä, voivat hyödyntää samoja hajautetun arkkitehtuurin malleja, joista on tullut standardi NVIDIA GPU-klustereissa, ilman, että heidän tarvitsee sitoutua omiin tiedonsiirtorajapintoihin.