TensorCast — запропонований розподілений шар Tensor as a Service (TaaS), який відокремлює керування станом тензорів від обчислень. Система має об’єднати роботу з вагами моделей, KV Cache і проміжними станами замість окремих, слабо пов’язаних рішень для рушія, мережі та сховища.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TensorCast, the unified programmable tensor lifecycle management layer proposed by Peking University, StepFun, and Beijing Universit. Article summary: TensorCast is a proposed “Tensor as a Service” (TaaS) layer: a distributed, programmable system for managing the identity, placement, movement, transformation, sharing, and materialization of tensor state independently o. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
TensorCast — це запропонований шар Tensor-as-a-Service (TaaS), тобто розподілена програмована система для керування життєвим циклом тензорів. Вона відповідає за ідентифікацію, розміщення, переміщення, перетворення, спільне використання та матеріалізацію тензорного стану окремо від обчислень, які цей стан створюють або використовують. 1
Ідея важлива не лише як чергова оптимізація інференсу. TensorCast має стати спільним рівнем керування для ваг моделей, блоків KV Cache та інших проміжних станів, які сьогодні часто обслуговуються різними компонентами інфраструктури.
Системи для запуску великих мовних моделей (LLM) працюють не тільки з незмінними вагами. Їм також потрібно швидко обробляти динамічні блоки KV Cache — кеш ключів і значень, у якому зберігається контекст попередніх токенів, — а також проміжні тензорні стани.
Традиційно цими завданнями займаються окремі частини стека: рушій інференсу, планувальник запитів, мережевий транспорт і сховище. Через таку фрагментацію політику, яка одночасно враховує локальність кешу, повторне використання ваг і розподіл навантаження, складно реалізувати без змін у кількох компонентах. 1
TensorCast пропонує винести керування життєвим циклом тензорів в окремий системний шар. Застосунок описує, що потрібно зробити зі станом, а середовище виконання саме організовує його пошук, розміщення, передачу, перетворення та підготовку до використання на доступних ресурсах кластера. 1
Це відрізняє TensorCast від звичайних об’єктних сховищ, які здебільшого працюють із даними як із непрозорими об’єктами, а також від обчислювальних фреймворків, орієнтованих передусім на планування завдань, а не на життєвий цикл тензорного стану. 1
У звичайній системі обслуговування LLM перенесення багатокрокового діалогу з одного інстансу на інший може вимагати одночасних змін у маршрутизаторі запитів, реалізації KV Cache всередині рушія та мережевому або кеш-бекенді.
У TensorCast політика може просто визначити тензорні об’єкти, що належать сесії, попросити розмістити або матеріалізувати їх на цільовому Worker і спрямувати туди наступні запити. Пошук, передача та прив’язка даних до пам’яті виконуються середовищем керування життєвим циклом. 1
Це не означає, що міграція стає безкоштовною. Перевага в іншому: її правила описуються один раз на рівні життєвого циклу тензорів, а не дублюються в кількох тісно пов’язаних компонентах. Так легше створювати політики маршрутизації з урахуванням кешу, повторного використання ваг або спільного розміщення пов’язаних станів. 1
Автори інтегрували TensorCast із двома популярними рушіями інференсу — vLLM і SGLang — та перевірили матеріалізацію і синхронізацію ваг, керування KV Cache і програмовану маршрутизацію запитів. 1
За заявленими результатами, продуктивність роботи з KV Cache була співставною з Mooncake — спеціалізованою системою для кешу, — водночас TensorCast зберігав можливість реалізовувати політики, що охоплюють кілька компонентів інфраструктури. 1
Для запуску інстансу Qwen3-235B-A22B, моделі із 235 мільярдами параметрів загалом і 22 мільярдами активованих параметрів, у статті вказано прискорення до 228,6 раза порівняно з поширеними розподіленими файловими системами. 1
2
У сценаріях із високою конкуренцією та багатокроковими агентними взаємодіями програмована політика TensorCast, за повідомленням авторів, зменшила медіанний time-to-first-token (TTFT) — час до появи першого токена відповіді — до 93,2%. 1
TensorCast показує напрям, у якому інфраструктура ШІ може перейти від набору вертикальних оптимізацій до єдиного програмованого шару для роботи зі станом моделей. Швидкий запуск інстансів, маршрутизація з урахуванням локальності кешу, міграція сесій і повторне використання вже завантажених тензорів можуть задаватися як системні політики, а не як окремі функції конкретного рушія чи сховища.
Водночас наведені показники є експериментальними результатами авторів дослідницького препринта. Для оцінки готовності TensorCast до промислового використання потрібні незалежне відтворення результатів і перевірка на production-навантаженнях. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TensorCast — запропонований розподілений шар Tensor as a Service (TaaS), який відокремлює керування станом тензорів від обчислень.
TensorCast — запропонований розподілений шар Tensor as a Service (TaaS), який відокремлює керування станом тензорів від обчислень. Система має об’єднати роботу з вагами моделей, KV Cache і проміжними станами замість окремих, слабо пов’язаних рішень для рушія, мережі та сховища.
У тестах із vLLM і SGLang TensorCast показав продуктивність, співставну зі спеціалізованою системою Mooncake, запуск Qwen3 235B A22B — до 228,6 раза швидше, а медіанний TTFT — до 93,2% нижчий.