TensorCast är ett distribuerat och programmerbart lager som hanterar tensorers identitet, placering, överföring, delning och materialisering oberoende av själva beräkningen. Målet är att samla hanteringen av modellvikter, KV cache och mellanresultat som i dag ofta ligger utspridd över inferensmotorer, nätverk och la...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TensorCast, the unified programmable tensor lifecycle management layer proposed by Peking University, StepFun, and Beijing Universit. Article summary: TensorCast is a proposed “Tensor as a Service” (TaaS) layer: a distributed, programmable system for managing the identity, placement, movement, transformation, sharing, and materialization of tensor state independently o. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
TensorCast är ett föreslaget lager enligt modellen Tensor-as-a-Service (TaaS): ett distribuerat system som programmerbart hanterar tensorers identitet, placering, förflyttning, omvandling, delning och materialisering – utan att vara bundet till den beräkning som skapar eller använder dem. 1
Det centrala är alltså inte en ny modell, utan en ny arkitektur för AI-drift. TensorCast försöker ersätta separata lösningar för exempelvis laddning av modellvikter, KV-cache, nätverksöverföring och lagring med ett gemensamt gränssnitt för hantering av tillstånd i dynamiska AI-tjänster. 1
Stora språkmodeller arbetar inte bara med permanenta modellvikter. De behöver också hantera mycket dynamiska tensorer, bland annat KV-cache – mellanlagrade nyckel- och värderepresentationer som gör att en modell kan fortsätta en flerturnsdialog utan att räkna om hela samtalet – samt andra mellanresultat.
I traditionella system är ansvaret ofta uppdelat mellan inferensmotorer, schemaläggare, nätverkslager och lagringsbackend. Det kan göra optimeringar svåra att kombinera: en förändring av hur cache ska flyttas kan kräva ändringar i flera tätt kopplade komponenter. 1
TensorCast behandlar därför tensorernas livscykel som ett eget systemlager. Applikationen beskriver vad som ska hända med ett tensorobjekt, medan körmiljön hanterar var det ska placeras, hur det ska flyttas och när det ska göras tillgängligt i klustret. 1
Det skiljer sig från ett vanligt objektlager, där data i regel behandlas som ogenomskinliga block, och från beräkningsorienterade ramverk som främst planerar uppgifter snarare än tensorernas livscykel. 1
Anta att en flerturnssession behöver flyttas från en överbelastad inferensinstans till en annan. I en traditionell serveringsstack kan det kräva samordnade ändringar i frågeroutern, inferensmotorns KV-cache-logik och cache- eller nätverksbackend.
Med TensorCast kan en policy i stället identifiera sessionens tensorobjekt för KV-cache, begära att de placeras och materialiseras hos en annan Worker och därefter styra nya förfrågningar dit. TensorCast ansvarar för uppslagning, överföring och koppling till minnet. 1
Det betyder inte att själva flytten blir kostnadsfri. Vinsten är att policyn uttrycks en gång på tensorlivscykelnivå, i stället för att implementeras på nytt i flera komponenter. Det gör det enklare att testa strategier som tar hänsyn till cache-lokalitet, återanvändning av modellvikter eller att relaterade tillstånd placeras nära varandra. 1
Forskarna integrerade TensorCast med både vLLM och SGLang och utvärderade bland annat materialisering och synkronisering av modellvikter, KV-cache-hantering samt programmerbar routning av förfrågningar. 1
De rapporterar att prestandan för KV-cache är jämförbar med Mooncake, ett specialiserat system för just KV-cache, samtidigt som TensorCast kan uttrycka policies som sträcker sig över flera systemkomponenter. 1
För att starta en instans av Qwen3-235B-A22B – en modell med totalt 235 miljarder parametrar, varav 22 miljarder aktiveras – uppges TensorCast ge upp till 228,6 gånger snabbare uppstart än vanliga distribuerade filsystem. 1
2
I arbetsbelastningar med många samtidiga flerturnsinteraktioner mellan agenter rapporteras en programmerbar TensorCast-policy dessutom ha sänkt medianen för TTFT, alltså tiden från förfrågan tills den första tokenen visas, med upp till 93,2 procent. 1
Resultaten pekar på att TensorCast kan vara användbart i elastisk och tillståndsfull AI-infrastruktur: modeller kan startas snabbare, routning kan ta hänsyn till var cachen finns och tensorer kan återanvändas mellan tjänster. I stället för att varje ramverk bygger sin egen speciallösning kan sådana funktioner uttryckas som programmerbara systempolicies. 1
Samtidigt är siffrorna forskarnas egna resultat från ett forskningsförtryck. Oberoende reproduktion och tester i produktionsmiljö återstår därför innan det går att avgöra hur väl fördelarna håller i praktisk drift. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TensorCast är ett distribuerat och programmerbart lager som hanterar tensorers identitet, placering, överföring, delning och materialisering oberoende av själva beräkningen.
TensorCast är ett distribuerat och programmerbart lager som hanterar tensorers identitet, placering, överföring, delning och materialisering oberoende av själva beräkningen. Målet är att samla hanteringen av modellvikter, KV cache och mellanresultat som i dag ofta ligger utspridd över inferensmotorer, nätverk och lagringssystem.
I tester integrerades systemet med vLLM och SGLang. Forskarna rapporterar upp till 228,6 gånger snabbare uppstart av en Qwen3 235B A22B instans och upp till 93,2 procent lägre median för tid till första token.