TensorCast — предлагаемая архитектура Tensor as a Service (TaaS), которая отделяет управление состоянием тензоров от вычислительной логики моделей. Система объединяет в едином программируемом слое операции размещения, перемещения, преобразования, репликации и материализации весов, KV Cache и промежуточных состояний.
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is TensorCast, the unified programmable tensor lifecycle management layer proposed by Peking University, StepFun, and Beijing Universit. Article summary: TensorCast is a proposed “Tensor as a Service” (TaaS) layer: a distributed, programmable system for managing the identity, placement, movement, transformation, sharing, and materialization of tensor state independently o. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
TensorCast — это предлагаемая распределённая прослойка Tensor-as-a-Service (TaaS) для управления жизненным циклом тензоров. Она отвечает за идентификацию, размещение, перемещение, преобразование, совместное использование и материализацию тензорных данных независимо от вычислений, которые эти данные создают или используют. 1
Главная идея проекта — заменить набор разрозненных механизмов для загрузки весов, работы с KV Cache, сетевой передачи и хранения общим программируемым интерфейсом. Такой подход особенно важен для динамической инфраструктуры больших языковых моделей, где состояние постоянно перемещается между узлами, GPU и уровнями хранения. 1
Современные системы обслуживания LLM работают не только с неизменяемыми весами модели. Им также приходится управлять постоянно меняющимися блоками KV Cache — промежуточным состоянием внимания, которое позволяет продолжать многошаговый диалог без повторного вычисления всей истории, — а также различными промежуточными тензорами.
Обычно эти задачи распределены между несколькими компонентами: движком инференса, планировщиком, маршрутизатором запросов, сетевым стеком и системой хранения. Каждый компонент реализует собственные правила размещения и передачи данных. В результате сложнее комбинировать оптимизации: например, одновременно учитывать локальность KV Cache, повторное использование весов и балансировку нагрузки. 1
TensorCast рассматривает управление жизненным циклом тензоров как отдельный недостающий системный слой. Приложение описывает, что должно произойти с состоянием, а среда выполнения самостоятельно выбирает, где разместить данные, как их переместить и в каком виде подготовить для потребителя. 1
Это отличает TensorCast от обычного объектного хранилища, где данные обычно представлены непрозрачными блоками, и от вычислительных фреймворков, которые в первую очередь планируют задачи, а не жизненный цикл тензорного состояния. 1
В традиционной системе перенос многошаговой сессии между экземплярами инференса обычно требует согласованных изменений сразу в нескольких местах: в маршрутизаторе запросов, реализации KV Cache внутри движка и сетевом или кэш-бэкенде.
В TensorCast политика может просто определить тензорные объекты, связанные с сессией, запросить их размещение или материализацию на целевом Worker и направить туда следующие запросы. Поиск состояния, его передача и привязка к памяти выполняются средой управления жизненным циклом. 1
Это не означает, что сама миграция становится бесплатной. Преимущество в другом: соответствующую политику можно выразить один раз на уровне управления тензорами, а не повторно реализовывать в нескольких тесно связанных компонентах. Такой подход упрощает создание стратегий, учитывающих локальность кэша, повторное использование весов или совместное размещение связанных состояний. 1
Авторы интегрировали TensorCast с двумя популярными движками инференса — vLLM и SGLang — и проверили материализацию и синхронизацию весов, управление KV Cache, а также программируемую маршрутизацию запросов. 1
По заявлению исследователей, производительность работы с KV Cache сопоставима с Mooncake — специализированной системой для KV Cache. При этом TensorCast сохраняет возможность задавать политики, охватывающие сразу несколько компонентов инфраструктуры. 1
Для запуска экземпляра Qwen3-235B-A22B, модели со 235 млрд параметров, из которых активируются 22 млрд, в статье заявлено ускорение до 228,6 раза по сравнению с распространёнными распределёнными файловыми системами. 1
2
В сценариях с высокой конкуренцией и многошаговыми агентными диалогами программируемая политика TensorCast, согласно результатам авторов, снизила медианное время до первого токена (TTFT, time-to-first-token) до 93,2%. 1
TensorCast предлагает не очередной отдельный кэш или загрузчик весов, а более общий способ обращаться с тензорным состоянием как с самостоятельным распределённым ресурсом. В перспективе это может упростить запуск новых экземпляров моделей, маршрутизацию с учётом кэш-локальности, миграцию сессий и повторное использование уже загруженных данных.
Однако приведённые показатели являются результатами экспериментов авторов исследовательского препринта. Для окончательной оценки системы потребуются независимое воспроизведение результатов и проверка в производственных кластерах. 1
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
TensorCast — предлагаемая архитектура Tensor as a Service (TaaS), которая отделяет управление состоянием тензоров от вычислительной логики моделей.
TensorCast — предлагаемая архитектура Tensor as a Service (TaaS), которая отделяет управление состоянием тензоров от вычислительной логики моделей. Система объединяет в едином программируемом слое операции размещения, перемещения, преобразования, репликации и материализации весов, KV Cache и промежуточных состояний.
В экспериментах с vLLM и SGLang авторы сообщили о запуске экземпляра Qwen3 235B A22B до 228,6 раза быстрее распределённых файловых систем и снижении медианного TTFT до 93,2% в многопоточных сценариях.