TensorCast is een voorgestelde gedistribueerde Tensor as a Service laag die de volledige levenscyclus van tensoren beheert, los van de rekenlogica van een AI model. De aanpak moet de versnipperde verwerking van modelgewichten, KV cache en tussenstaten over inference engines, netwerken en opslag vereenvoudigen.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TensorCast, the unified programmable tensor lifecycle management layer proposed by Peking University, StepFun, and Beijing Universit. Article summary: TensorCast is a proposed “Tensor as a Service” (TaaS) layer: a distributed, programmable system for managing the identity, placement, movement, transformation, sharing, and materialization of tensor state independently o. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
TensorCast is een voorgestelde Tensor-as-a-Service-laag (TaaS): een gedistribueerd en programmeerbaar systeem dat de identiteit, locatie, verplaatsing, transformatie, deling en materialisatie van tensoren beheert — onafhankelijk van de berekening die deze tensoren produceert of gebruikt. 1
Het belang zit vooral in de architectuur. In plaats van aparte oplossingen voor het laden van modelgewichten, het opslaan van KV-cache, netwerkverkeer en backend-opslag, wil TensorCast één gemeenschappelijke beheerlaag bieden voor dynamische AI-diensten. 1
Grote taalmodellen werken niet alleen met relatief vaste modelgewichten. Tijdens het gebruik ontstaan ook dynamische gegevens, zoals KV-cache: tussenresultaten die nodig zijn om vervolgberichten in een gesprek sneller te verwerken. Daarnaast zijn er andere tijdelijke of permanente tussenstaten.
Traditioneel worden deze gegevens beheerd door verschillende onderdelen van de stack: de inference-engine, request-router, scheduler, netwerklaag en opslagbackend. Daardoor worden optimalisaties vaak afzonderlijk ingebouwd. Een wijziging die meerdere onderdelen tegelijk raakt — bijvoorbeeld het verplaatsen van een gesprek mét zijn KV-cache — kan dan complex en onderhoudsgevoelig worden. 1
TensorCast behandelt tensorbeheer daarom als een ontbrekende infrastructuurlaag. Een applicatie beschrijft wat er met de tensorstaat moet gebeuren; de runtime bepaalt vervolgens hoe die staat over de beschikbare servers, GPU's, CPU's en opslag wordt geplaatst, verplaatst, getransformeerd of klaargemaakt voor gebruik. 1
Dat onderscheidt TensorCast van een gewone object store, die gegevens meestal als ondoorzichtige bestanden of blobs behandelt. Ook verschilt het van compute-georiënteerde frameworks, die vooral taken plannen en niet de levenscyclus van tensorstaat beheren. 1
memfd-handles. Voor externe bronnen ondersteunt TensorCast directe RDMA-schrijfbewerkingen. Dat beperkt onnodige kopieën en maakt directe GPU-naar-GPU- of lokale deelpaden mogelijk wanneer de hardware dit ondersteunt. In een traditionele serving-architectuur kan het verplaatsen van een meerturngesprek betekenen dat tegelijk de request-router, de KV-cache-implementatie van de inference-engine en de cache- of netwerkbackend moeten worden aangepast.
Met TensorCast kan een beheerbeleid in plaats daarvan de tensorobjecten van de sessie identificeren, vragen om deze op de doelworker te plaatsen en te materialiseren, en toekomstige verzoeken naar die worker sturen. De runtime verzorgt vervolgens het opzoeken, transporteren en koppelen aan het geheugen. 1
De winst is niet dat migratie kosteloos wordt. De winst is dat het beleid één keer op de tensorlevenscycluslaag kan worden beschreven, in plaats van opnieuw te worden geïmplementeerd in verschillende nauw gekoppelde componenten. Dat maakt strategieën zoals routering op basis van cache-lokaliteit, hergebruik van modelgewichten en het bij elkaar plaatsen van gerelateerde toestand eenvoudiger te testen en in te voeren. 1
De onderzoekers integreerden TensorCast met vLLM en SGLang. Ze testten onder meer het materialiseren en synchroniseren van modelgewichten, het beheer van KV-cache en programmeerbare routering van verzoeken. 1
Volgens de auteurs waren de prestaties voor KV-cache concurrerend met die van Mooncake, een gespecialiseerd systeem voor KV-cache. TensorCast zou daarbij flexibeler zijn voor beleid dat meerdere onderdelen van de infrastructuur tegelijk omvat. 1
Voor het opstarten van een instantie van Qwen3-235B-A22B — een model met in totaal 235 miljard parameters, waarvan 22 miljard worden geactiveerd — rapporteert het onderzoek een tot 228,6 keer snellere opstart dan bij gangbare gedistribueerde bestandssystemen. 1
2
In workloads met veel gelijktijdige, meerturninteracties voor AI-agents zou een programmeerbaar TensorCast-beleid de mediane time-to-first-token (TTFT) met maximaal 93,2% hebben verlaagd. TTFT is de tijd tussen het versturen van een verzoek en het verschijnen van het eerste gegenereerde token. 1
De resultaten wijzen op een mogelijke nieuwe manier om elastische en stateful AI-diensten te bouwen. Het snel opstarten van modellen, routeren op basis van cache-locatie, migreren van sessies en hergebruiken van tensorstaat kunnen dan worden behandeld als programmeerbaar infrastructuurbeleid — en niet als losse optimalisaties die telkens in een specifiek framework moeten worden ingebouwd.
Wel is voorzichtigheid geboden. De genoemde prestatiecijfers zijn door de auteurs gerapporteerde resultaten uit een onderzoeksvoorpublicatie. Onafhankelijke reproductie en validatie op productieschaal zijn dus nog nodig. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TensorCast is een voorgestelde gedistribueerde Tensor as a Service laag die de volledige levenscyclus van tensoren beheert, los van de rekenlogica van een AI model.
TensorCast is een voorgestelde gedistribueerde Tensor as a Service laag die de volledige levenscyclus van tensoren beheert, los van de rekenlogica van een AI model. De aanpak moet de versnipperde verwerking van modelgewichten, KV cache en tussenstaten over inference engines, netwerken en opslag vereenvoudigen.
In tests met vLLM en SGLang rapporteerden de auteurs prestaties die concurrerend waren met het gespecialiseerde Mooncake systeem, tot 228,6 keer snellere modelopstart en tot 93,2% lagere mediane TTFT.