TensorCast on ehdotettu Tensor as a Service eli TaaS kerros, joka hallitsee tensorien tunnistamista, sijoittelua, siirtämistä, muuntamista, jakamista ja käyttöönottoa erillään niitä käyttävästä laskennasta. Tavoitteena on korvata erilliset ratkaisut mallipainoille, KV välimuistille, verkkosiirroille ja tallennuksell...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TensorCast, the unified programmable tensor lifecycle management layer proposed by Peking University, StepFun, and Beijing Universit. Article summary: TensorCast is a proposed “Tensor as a Service” (TaaS) layer: a distributed, programmable system for managing the identity, placement, movement, transformation, sharing, and materialization of tensor state independently o. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
TensorCast on Pekingin yliopiston, tekoäly-yhtiö StepFunin ja Beijing University of Posts and Telecommunicationsin ehdottama hajautettu järjestelmäkerros. Sen perusidea on käsitellä tensorien elinkaarta omana ohjelmoitavana kokonaisuutenaan – riippumatta siitä, mikä laskentamoottori tensorit tuottaa tai kuluttaa. 1
Käytännössä TensorCast pyrkii tarjoamaan yhteisen tavan hallita suurten tekoälymallien tilaa: mallipainoja, keskustelujen KV-välimuistia sekä muita välitiloja. Tällöin sovelluksen ei tarvitse erikseen tietää, millä palvelimella, millä grafiikkasuorittimella tai millä tallennusmedialla tietty tensoritila sijaitsee. Runtime-ympäristö huolehtii paikantamisesta, siirtämisestä ja käyttöön valmistelusta.
Suurten kielimallien palveluissa hallittavana ei ole vain itse malli. Mallipainot ovat suhteellisen pysyvää dataa, mutta KV-välimuisti muuttuu jatkuvasti keskustelujen edetessä. Lisäksi järjestelmät käsittelevät erilaisia välitiloja, joita voidaan joutua siirtämään, jakamaan tai säilyttämään klusterin eri osissa. 1
Perinteisesti nämä tehtävät on hajautettu useisiin toisiinsa kytkeytyviin komponentteihin: päättelymoottoriin, pyyntöjen reititykseen, ajoittimeen, verkkokerrokseen ja tallennusjärjestelmään. Jokainen uusi optimointi voi siksi vaatia muutoksia useaan paikkaan. TensorCastin ehdotus on tehdä tensorien elinkaaren hallinnasta oma abstraktiokerroksensa.
Tämä erottaa sen tavallisesta objektitallennuksesta, joka yleensä käsittelee dataa läpinäkymättöminä bitteinä. TensorCast puolestaan ymmärtää tensorin identiteetin, sijainnin, omistajuuden ja elinkaaren. Se eroaa myös laskentakeskeisistä viitekehyksistä, joiden päätehtävä on laskentatehtävien ajoittaminen eikä tensoritilan hallinta. 1
Monikierroksisessa keskustelussa käyttäjän aiempaan historiaan liittyvä KV-välimuisti voi olla tärkeä siirtää uuden päättelyinstanssin yhteyteen esimerkiksi kuormituksen tasaamiseksi. Perinteisessä palvelupinossa tämä voi edellyttää samanaikaisia muutoksia pyyntöjen reitittimeen, päättelymoottorin KV-toteutukseen sekä välimuisti- ja verkkotaustajärjestelmään.
TensorCastissa käytäntö voi sen sijaan tunnistaa istunnon KV-tensorit, pyytää niiden sijoittelua ja materialisointia kohde-Workerille sekä ohjata tulevat pyynnöt sinne. TensorCastin elinkaariajonaikainen ympäristö hoitaa haun, siirron ja muistiosoitusten sitomisen. 1
Tämä ei tee siirrosta ilmaista tai poista verkkoliikenteen kustannuksia. Hyöty on siinä, että siirtokäytäntö voidaan kuvata yhdellä hallintakerroksella sen sijaan, että sama logiikka rakennettaisiin erikseen useisiin tiukasti kytkeytyviin komponentteihin. Samalla on helpompi kokeilla esimerkiksi välimuistin sijaintiin perustuvaa reititystä, mallipainojen uudelleenkäyttöä tai toisiinsa liittyvien tilojen sijoittamista samalle solmulle. 1
Tutkijat yhdistivät TensorCastin vLLM- ja SGLang-päättelykehikoihin. Kokeissa tarkasteltiin muun muassa mallipainojen materialisointia ja synkronointia, KV-välimuistin hallintaa sekä ohjelmoitavaa pyyntöjen reititystä. 1
Raportin mukaan KV-välimuistin suorituskyky oli kilpailukykyinen Mooncaken kanssa. Mooncake on tähän käyttötarkoitukseen erikoistunut KV-välimuistijärjestelmä, kun taas TensorCast pyrkii säilyttämään mahdollisuuden rakentaa käytäntöjä useiden järjestelmäkomponenttien yli. 1
Qwen3-235B-A22B:n käynnistyksessä TensorCastin kerrotaan olleen parhaimmillaan 228,6 kertaa nopeampi kuin tavanomaiset hajautetut tiedostojärjestelmät. Mallissa on yhteensä 235 miljardia parametria, joista 22 miljardia aktivoituu. 1
2
Korkean samanaikaisuuden monikierroksisissa agenttikuormissa ohjelmoitava TensorCast-käytäntö pienensi raportin mukaan mediaaniaikaa ensimmäiseen tokeniin eli TTFT-aikaa (time to first token) parhaimmillaan 93,2 prosenttia. 1
TensorCastin merkitys on ennen kaikkea arkkitehtuurissa. Jos mallipainojen, KV-välimuistin ja muiden tensoritilojen hallinta voidaan toteuttaa yhteisen kerroksen kautta, tekoälypalveluista voi olla helpompi rakentaa elastisia, tilallisia ja kuormitukseen mukautuvia.
Raportoidut tulokset viittaavat siihen, että mallien nopea käyttöönotto, välimuistin sijaintiin perustuva reititys, tilan siirtäminen ja tensorien uudelleenkäyttö voidaan kuvata ohjelmoitavina järjestelmäkäytäntöinä erillisten, kehyskohtaisten optimointien sijaan.
On kuitenkin hyvä huomata, että luvut ovat tutkijoiden raportoimia kokeellisia tuloksia tutkimuksen esiversiosta. Riippumaton toistaminen ja laajamittainen tuotantokäytön validointi ovat vielä tarpeen, ennen kuin suorituskyky- ja ylläpitohyödyt voidaan arvioida lopullisesti. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TensorCast on ehdotettu Tensor as a Service eli TaaS kerros, joka hallitsee tensorien tunnistamista, sijoittelua, siirtämistä, muuntamista, jakamista ja käyttöönottoa erillään niitä käyttävästä laskennasta.
TensorCast on ehdotettu Tensor as a Service eli TaaS kerros, joka hallitsee tensorien tunnistamista, sijoittelua, siirtämistä, muuntamista, jakamista ja käyttöönottoa erillään niitä käyttävästä laskennasta. Tavoitteena on korvata erilliset ratkaisut mallipainoille, KV välimuistille, verkkosiirroille ja tallennukselle yhteisellä ohjelmoitavalla hallintakerroksella.
Tutkimusraportin kokeissa Qwen3 235B A22B mallin instanssin käynnistys nopeutui parhaimmillaan 228,6 kertaiseksi, ja korkean samanaikaisuuden monikierroksisissa agenttikuormissa ensimmäisen tokenin odotusaika lyheni j...