TensorCast er et distribueret og programmerbart Tensor as a Service lag, der styrer tensorers placering, flytning, deling og materialisering uafhængigt af den beregning, der bruger dem. Systemet er udviklet for at samle funktioner, som traditionelt ligger spredt mellem inferensmotorer, netværk, cachesystemer og lage...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TensorCast, the unified programmable tensor lifecycle management layer proposed by Peking University, StepFun, and Beijing Universit. Article summary: TensorCast is a proposed “Tensor as a Service” (TaaS) layer: a distributed, programmable system for managing the identity, placement, movement, transformation, sharing, and materialization of tensor state independently o. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
TensorCast er et foreslået Tensor-as-a-Service-lag (TaaS): et distribueret system, der gør det muligt at administrere tensorers identitet, placering, flytning, transformation, deling og materialisering uafhængigt af den beregning, som producerer eller bruger dem. 1
Den arkitektoniske idé er at erstatte en række særskilt udviklede løsninger til indlæsning af modelvægte, håndtering af KV-cache, netværksoverførsel og lagring med én fælles, programmerbar styringsflade til dynamisk AI-drift.
Store sprogmodeller arbejder ikke kun med permanente modelvægte. De skal også håndtere dynamiske KV-cache-blokke og andre mellemtilstande, som kan ligge fordelt på flere noder, GPU'er og lagermedier.
I traditionelle systemer er disse opgaver ofte indbygget i forskellige dele af stakken: inferensmotoren, request-routeren, scheduler'en, netværkslaget og backend-lageret. Det kan gøre det vanskeligt at kombinere eller ændre optimeringer på tværs af komponenterne. 1
TensorCast behandler derfor tensorernes livscyklus som et selvstændigt infrastrukturlag. En applikation kan beskrive, hvad der skal ske med en tensor, mens runtime-systemet vælger og udfører placering, flytning, transformation og materialisering på tværs af klyngens ressourcer. 1
Det adskiller sig fra et almindeligt objektlager, hvor data typisk behandles som uigennemsigtige blokke, og fra beregningscentrerede frameworks, der først og fremmest planlægger opgaver – ikke tensorernes samlede livscyklus. 1
I en traditionel serving-stack kan flytningen af en flertrådet eller flerturn-baseret session kræve koordinerede ændringer i request-routeren, inferensmotorens KV-cache-implementering og cache- eller netværksbackenden.
Med TensorCast kan en politik i stedet identificere sessionens KV-tensorobjekter, bede om at få dem placeret eller materialiseret hos den ønskede Worker og derefter sende fremtidige forespørgsler dertil. Runtime-systemet håndterer opslag, overførsel og binding til hukommelsen. 1
Det betyder ikke, at selve flytningen er gratis. Fordelen er, at politikken kan udtrykkes én gang på tensorernes livscykluslag i stedet for at skulle implementeres igen i flere tæt koblede komponenter. Det gør det lettere at afprøve politikker, der for eksempel tager hensyn til cache-lokalitet, genbrug af modelvægte eller samplacering af relaterede tilstande. 1
Forskerne har integreret TensorCast med både vLLM og SGLang og evalueret blandt andet materialisering og synkronisering af modelvægte, KV-cache-håndtering og programmerbar routing af forespørgsler. 1
De rapporterer, at TensorCast opnår KV-cache-resultater, der er konkurrencedygtige med Mooncake, et specialiseret KV-cache-system, samtidig med at TensorCast kan udtrykke politikker på tværs af flere systemkomponenter. 1
For opstart af en instans af Qwen3-235B-A22B – en model med 235 milliarder parametre, hvor 22 milliarder er aktiverede – rapporterer artiklen op til 228,6 gange hurtigere opstart end almindelige distribuerede filsystemer. 1
2
I arbejdsbelastninger med mange samtidige brugere og flertrins-agentdialoger reducerede en programmerbar TensorCast-politik ifølge forskerne medianen for time-to-first-token (TTFT) med op til 93,2 procent. TTFT er den tid, der går, før brugeren modtager modellens første token. 1
Resultaterne peger på, at TensorCast kan få betydning for mere elastisk og tilstandsbevidst AI-infrastruktur. Hurtigere opstart af modeller, routing baseret på cache-lokalitet, flytning af aktive sessioner og genbrug af tensorer kan håndteres som programmerbare systempolitikker frem for som isolerede optimeringer i hvert enkelt framework. 1
Det er dog vigtigt at sætte resultaterne i perspektiv: Tallene stammer fra forfatternes egne eksperimenter i et forskningspreprint. Uafhængig reproduktion og validering i produktionsskala er derfor stadig nødvendig, før TensorCast kan vurderes som en moden standard for AI-infrastruktur. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TensorCast er et distribueret og programmerbart Tensor as a Service lag, der styrer tensorers placering, flytning, deling og materialisering uafhængigt af den beregning, der bruger dem.
TensorCast er et distribueret og programmerbart Tensor as a Service lag, der styrer tensorers placering, flytning, deling og materialisering uafhængigt af den beregning, der bruger dem. Systemet er udviklet for at samle funktioner, som traditionelt ligger spredt mellem inferensmotorer, netværk, cachesystemer og lagerløsninger.
Forskerne integrerede TensorCast med vLLM og SGLang og rapporterer op til 228,6 gange hurtigere opstart af en Qwen3 235B A22B instans samt op til 93,2 procent lavere median tid til første token i bestemte agentarbejds...