TensorCast es una capa de tipo “Tensor as a Service” que administra la identidad, ubicación, movimiento, transformación y materialización de tensores sin ligarlos a un motor de cómputo concreto. Su objetivo es unificar la gestión de pesos del modelo, bloques de KV Cache y estados intermedios, hoy repartida entre mot...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What is TensorCast, the unified programmable tensor lifecycle management layer proposed by Peking University, StepFun, and Beijing Universit. Article summary: TensorCast is a proposed “Tensor as a Service” (TaaS) layer: a distributed, programmable system for managing the identity, placement, movement, transformation, sharing, and materialization of tensor state independently o. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
TensorCast es una propuesta de capa “Tensor-as-a-Service” (TaaS): un sistema distribuido y programable que gestiona el ciclo de vida de los tensores —su identidad, ubicación, movimiento, transformación, intercambio y materialización— de forma independiente del cómputo que los produce o consume. 1
La idea es introducir una capa común allí donde hoy suelen convivir soluciones separadas: cargadores de pesos, sistemas de KV Cache, rutas de red, planificadores y backends de almacenamiento. En lugar de optimizar cada componente por separado, las aplicaciones podrían definir políticas sobre el estado tensorial y dejar que el runtime ejecute su colocación y transferencia dentro del clúster. 1
Los sistemas que sirven grandes modelos de lenguaje no solo deben cargar los pesos del modelo. También tienen que mover y conservar bloques de KV Cache —la información intermedia que permite continuar una conversación sin recalcular todo desde cero—, además de otros estados temporales.
Tradicionalmente, cada tipo de dato queda ligado a una parte distinta de la infraestructura: el motor de inferencia administra una parte, el router decide a qué instancia enviar una petición, la red mueve los datos y el almacenamiento conserva determinadas copias. Esta fragmentación dificulta combinar políticas como reutilizar pesos, enrutar según la localidad de la caché o trasladar una sesión junto con su estado. 1
TensorCast plantea que la gestión del ciclo de vida de los tensores es una capa de sistemas que falta. A diferencia de un almacén de objetos convencional, que suele tratar los datos como bloques opacos, TensorCast les asigna identidad, propiedad, ubicación y reglas de ciclo de vida explícitas. Y, a diferencia de un framework centrado en el cómputo, no se limita a programar tareas: también coordina qué ocurre con el estado tensorial antes, durante y después de la ejecución. 1
El sistema utiliza distintas estrategias según el tipo de estado. Los objetos relativamente estáticos y de baja cardinalidad, como los pesos del modelo, pueden registrarse de forma centralizada en el Global Store. Los estados dinámicos y numerosos, como los bloques de KV Cache, se distribuyen entre shards; un Worker responsable de cada shard mantiene la propiedad y la consistencia mediante arrendamientos (leases) y tokens de bloqueo (fencing tokens). 1
Cuando un tensor debe estar disponible para un motor, TensorCast puede exponer réplicas en memoria GPU mediante CUDA IPC o en memoria CPU mediante identificadores locales memfd. Para fuentes remotas, admite escrituras directas a través de RDMA, una tecnología de red de baja latencia que permite transferir datos entre máquinas con una intervención reducida del procesador. 6
La meta es evitar copias innecesarias y aprovechar rutas de intercambio directo entre GPUs o dentro del mismo nodo cuando están disponibles. En la práctica, esto permite que la ubicación física del tensor quede desacoplada de la lógica de la aplicación, sin renunciar a mecanismos de transferencia eficientes.
En un servicio convencional, trasladar una conversación de varias rondas a otra instancia puede exigir cambios coordinados en tres lugares: el router de peticiones, la implementación de KV Cache del motor de inferencia y el backend de caché o red.
Con TensorCast, una política puede identificar los objetos tensoriales asociados a la sesión, solicitar su colocación o materialización en el Worker de destino y dirigir allí las siguientes peticiones. El runtime se encarga de localizar los datos, transferirlos y vincularlos a la memoria correspondiente. 1
Esto no significa que migrar una sesión sea gratuito. La ventaja es que la política se expresa una sola vez en la capa de gestión del ciclo de vida, en lugar de duplicarse en varios componentes estrechamente conectados. De ese modo resulta más sencillo probar estrategias que crucen fronteras del sistema, como enrutar según la localidad de la caché, reutilizar pesos o colocar juntos estados relacionados. 1
Los autores integraron TensorCast con vLLM y SGLang, dos frameworks utilizados para servir modelos de lenguaje, y evaluaron la materialización y sincronización de pesos, la gestión de KV Cache y el enrutamiento programable de peticiones. 1
Entre los resultados comunicados se encuentran los siguientes:
Estos datos apuntan al potencial de TensorCast para una infraestructura de IA elástica y con estado: el arranque rápido de modelos, el enrutamiento consciente de la caché, la migración de sesiones y la reutilización de tensores podrían tratarse como políticas programables, en vez de como optimizaciones aisladas de cada framework.
Aun así, las cifras proceden de los experimentos comunicados por los autores en un preprint de investigación. Será necesario reproducirlas de forma independiente y comprobar su comportamiento en entornos de producción a gran escala antes de extraer conclusiones definitivas. 1
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
TensorCast es una capa de tipo “Tensor as a Service” que administra la identidad, ubicación, movimiento, transformación y materialización de tensores sin ligarlos a un motor de cómputo concreto.
TensorCast es una capa de tipo “Tensor as a Service” que administra la identidad, ubicación, movimiento, transformación y materialización de tensores sin ligarlos a un motor de cómputo concreto. Su objetivo es unificar la gestión de pesos del modelo, bloques de KV Cache y estados intermedios, hoy repartida entre motores de inferencia, redes, planificadores y sistemas de almacenamiento.
La arquitectura separa el plano de control —coordinado por el Global Store— del plano de datos, donde los Workers realizan las transferencias, incluso mediante RDMA y rutas con pocas copias.