TensorCast ialah lapisan “Tensor as a Service” (TaaS) yang mengasingkan pengurusan keadaan tensor daripada logik pengiraan model AI. Sistem ini menyatukan pengurusan pemberat model, blok KV Cache dan keadaan perantaraan yang sebelum ini dikendalikan oleh komponen pengkomputeran, rangkaian serta storan yang berasingan.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TensorCast, the unified programmable tensor lifecycle management layer proposed by Peking University, StepFun, and Beijing Universit. Article summary: TensorCast is a proposed “Tensor as a Service” (TaaS) layer: a distributed, programmable system for managing the identity, placement, movement, transformation, sharing, and materialization of tensor state independently o. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
TensorCast ialah lapisan “Tensor-as-a-Service” (TaaS) yang dicadangkan oleh Universiti Peking, StepFun dan Beijing University of Posts and Telecommunications. Ia merupakan sistem teragih dan boleh atur cara untuk mengurus keseluruhan kitar hayat keadaan tensor—daripada mengenal pasti, menempatkan dan memindahkan tensor kepada mengubah, berkongsi serta menyediakan tensor itu untuk digunakan—tanpa mengikat pengurusan tersebut kepada enjin pengiraan yang menghasilkan atau menggunakannya. 1
Secara ringkas, TensorCast cuba menyediakan satu “pusat kawalan” bersama bagi pemberat model, KV Cache dan keadaan tensor perantaraan. Pendekatan ini boleh menggantikan sebahagian daripada sistem yang biasanya dibina secara berasingan, seperti pemuat pemberat, pengurus KV Cache, laluan rangkaian dan bahagian belakang storan. 1
Sistem model bahasa besar perlu mengurus tensor yang bukan sahaja besar, tetapi juga tersebar di seluruh kluster dan berubah mengikut beban kerja. Keperluannya merangkumi:
Dalam susunan tradisional, setiap keperluan ini sering tertanam dalam enjin inferens, penjadual, sistem rangkaian atau bahagian belakang storan yang berbeza. Akibatnya, sesuatu pengoptimuman baharu—contohnya menghala permintaan berdasarkan lokasi cache—mungkin memerlukan perubahan pada beberapa komponen serentak. 1
TensorCast melihat pengurusan kitar hayat tensor sebagai lapisan sistem yang masih hilang. Aplikasi hanya menyatakan perkara yang perlu berlaku kepada keadaan tensor, manakala runtime TensorCast menentukan cara tensor itu ditempatkan, dipindahkan, diubah atau disediakan merentas sumber dalam kluster. 1
Berbeza dengan stor objek biasa yang lazimnya menganggap data sebagai blok atau “blob” legap, TensorCast menganggap tensor sebagai objek yang mempunyai makna, lokasi dan kitar hayat tersendiri. Ia juga berbeza daripada rangka kerja berpusatkan pengiraan, yang lebih menumpukan penjadualan tugas berbanding pengurusan keadaan tensor. 1
Setiap tensor mempunyai identiti, pemilikan, lokasi dan semantik kitar hayat yang jelas. Dengan itu, enjin boleh merujuk kepada sesuatu pemberat, blok KV Cache atau keadaan perantaraan tanpa perlu mengetahui tensor tersebut berada pada nod mana, GPU mana atau jenis storan apa. 1
Pembangun boleh menggabungkan operasi seperti pemindahan, transformasi, prefetching, replikasi dan materialisasi untuk membentuk dasar yang sesuai dengan beban kerja tertentu. Mereka tidak perlu mengubah infrastruktur aras rendah setiap kali mahu mencuba pengoptimuman baharu. 1
Dasar pengurusan tensor boleh ditulis melalui API TensorCast, manakala runtime mengendalikan pelaksanaan teragih dan pemindahan data. Pendekatan ini membolehkan dasar baharu diuji tanpa memerlukan perubahan besar pada enjin pelaksanaan asas. 1
Global Store (GS) menyimpan metadata kluster, termasuk keadaan Worker atau nod, lokasi tensor, pemilikan dan maklumat penjadualan. Worker pula menjalankan pemindahan data sebenar.
Oleh sebab GS menyelaras pemindahan tanpa membawa muatan tensor itu sendiri, ia tidak mudah menjadi kesesakan utama pemindahan data. 1
TensorCast turut menggunakan dua pendekatan metadata. Objek yang bilangannya rendah dan agak statik, seperti pemberat model, boleh dijejaki secara berpusat dalam GS. Keadaan yang lebih banyak dan dinamik, seperti KV Cache, dipecahkan kepada beberapa bahagian. Worker yang menjadi “rumah” bagi sesuatu bahagian mengekalkan pemilikan dan konsistensinya menggunakan pajakan serta token pagar (fencing token). 1
Replika pada Worker boleh mendedahkan memori GPU melalui CUDA IPC, manakala memori CPU boleh dikongsi menggunakan pemegang memfd tempatan. Bagi sumber jauh, TensorCast menyokong penulisan terus melalui RDMA. Kaedah ini mengurangkan salinan yang tidak perlu dan membolehkan perkongsian GPU-ke-GPU atau laluan tempatan digunakan apabila tersedia. 6
Dalam sistem penyajian model biasa, pemindahan sesi perbualan berbilang giliran mungkin memerlukan perubahan serentak pada penghala permintaan, pelaksanaan KV Cache dalam enjin inferens serta bahagian belakang cache dan rangkaian.
Dengan TensorCast, satu dasar boleh mengenal pasti objek tensor KV bagi sesuatu sesi, meminta objek tersebut ditempatkan atau dimaterialisasikan pada Worker destinasi, kemudian menghalakan permintaan seterusnya ke sana. Runtime mengurus carian, pemindahan dan pemetaan memori. 1
Ini tidak bermakna pemindahan KV Cache menjadi percuma. Kelebihan utamanya ialah logik dasar itu ditulis sekali pada lapisan kitar hayat tensor, bukannya dibina semula dalam beberapa komponen yang saling bergantung. Hasilnya, strategi merentas komponen—seperti penghalaan berdasarkan kedekatan cache, penggunaan semula pemberat atau penempatan bersama keadaan yang berkaitan—menjadi lebih mudah untuk diuji dan dilaksanakan. 1
Penulis mengintegrasikan TensorCast dengan vLLM dan SGLang, kemudian menilai beberapa tugasan termasuk materialisasi pemberat, penyegerakan pemberat, pengurusan KV Cache dan penghalaan permintaan boleh atur cara. 1
Antara keputusan yang dilaporkan ialah:
Keputusan tersebut menunjukkan potensi TensorCast untuk infrastruktur AI yang lebih anjal dan mengekalkan keadaan. Penyedia perkhidmatan boleh mempercepatkan penyediaan contoh model, menghalakan permintaan berdasarkan lokasi cache, memindahkan sesi aktif dan menggunakan semula keadaan tensor tanpa menjadikan setiap pengoptimuman sebagai ciri khusus bagi satu enjin atau sistem storan. 1
Namun begitu, angka prestasi ini ialah keputusan eksperimen yang dilaporkan oleh penulis dalam prapenerbitan penyelidikan. Penghasilan semula oleh pihak bebas dan pengesahan pada skala produksi masih diperlukan sebelum kesimpulan muktamad dibuat. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TensorCast ialah lapisan “Tensor as a Service” (TaaS) yang mengasingkan pengurusan keadaan tensor daripada logik pengiraan model AI.
TensorCast ialah lapisan “Tensor as a Service” (TaaS) yang mengasingkan pengurusan keadaan tensor daripada logik pengiraan model AI. Sistem ini menyatukan pengurusan pemberat model, blok KV Cache dan keadaan perantaraan yang sebelum ini dikendalikan oleh komponen pengkomputeran, rangkaian serta storan yang berasingan.
Seni bina Global Store dan Worker memisahkan metadata daripada pemindahan data, manakala CUDA IPC dan RDMA membantu mengurangkan salinan data yang tidak perlu.