TensorCast, tensör durumlarının konumunu, taşınmasını, dönüştürülmesini, paylaşılmasını ve belleğe alınmasını yöneten dağıtık bir Tensor as a Service (TaaS) katmanı olarak tasarlanıyor. Sistem; model ağırlıkları, KV Cache blokları ve ara durumları hesaplama, ağ ve depolama bileşenlerinden ayırarak farklı optimizasyo...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is TensorCast, the unified programmable tensor lifecycle management layer proposed by Peking University, StepFun, and Beijing Universit. Article summary: TensorCast is a proposed “Tensor as a Service” (TaaS) layer: a distributed, programmable system for managing the identity, placement, movement, transformation, sharing, and materialization of tensor state independently o. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
TensorCast, büyük yapay zekâ modellerinde kullanılan tensörlerin yaşam döngüsünü yönetmek için önerilen dağıtık ve programlanabilir bir sistem katmanı. Tensor-as-a-Service (TaaS) olarak tanımlanan yaklaşım; model ağırlıklarının, KV Cache bloklarının ve ara tensör durumlarının kimliğini, konumunu, sahipliğini, taşınmasını, dönüştürülmesini, paylaşılmasını ve bellekte kullanılabilir hâle getirilmesini, bu verileri üreten veya kullanan hesaplama motorundan ayırıyor. 1
Bu yaklaşımın temel iddiası mimariyle ilgili: Ağırlık yükleyicileri, KV Cache sistemleri, ağ aktarım mekanizmaları ve depolama arka uçları için ayrı ayrı geliştirilen çözümler yerine, tensör durumunu yöneten ortak bir kontrol yüzeyi oluşturmak.
Büyük dil modellerinin çalıştırıldığı sistemlerde yönetilmesi gereken veri yalnızca model ağırlıklarından ibaret değil. Çok turlu sohbetlerde sürekli değişen KV Cache blokları ve farklı hesaplama adımlarında oluşan ara durumlar da dağıtık biçimde saklanıp taşınabiliyor. Geleneksel altyapılarda bu sorumluluklar genellikle çıkarım motoru, istek yönlendiricisi, zamanlayıcı, ağ katmanı ve depolama sistemi arasında parçalı hâlde bulunuyor. Bu da birden fazla bileşeni ilgilendiren optimizasyonların geliştirilmesini ve değiştirilmesini zorlaştırıyor. 1
TensorCast, bu parçalanmayı bir "eksik sistem katmanı" olarak ele alıyor. Uygulama, bir tensör durumuyla ne yapılması gerektiğini bir politika olarak tanımlıyor; çalışma zamanı ise uygun yerleştirme, veri aktarımı, dönüştürme ve bellekte materyalizasyon işlemlerini küme kaynakları üzerinde yürütüyor. 1
Bu model, veriyi çoğunlukla opak bir nesne veya dosya olarak gören klasik nesne depolarından ayrılıyor. Aynı zamanda, odağı öncelikle görev planlaması olan hesaplama merkezli çerçevelerden farklı olarak doğrudan tensör durumlarının yaşam döngüsünü yönetiyor. 1
Geleneksel bir sunum altyapısında, çok turlu bir oturumu başka bir çıkarım örneğine taşımak için istek yönlendiricisinin, çıkarım motorundaki KV Cache uygulamasının ve önbellek ya da ağ arka ucunun birlikte değiştirilmesi gerekebiliyor. TensorCast yaklaşımında ise politika, oturuma ait KV tensör nesnelerini belirleyip bunların hedef Worker üzerinde konumlandırılmasını veya bellekte kullanılabilir hâle getirilmesini isteyebiliyor. Sonraki istekler hedefe yönlendirildiğinde arama, aktarım ve bellek bağlama işlemlerini yaşam döngüsü çalışma zamanı üstleniyor. 1
Buradaki kazanım, taşımanın maliyetsiz hâle gelmesi değil; taşıma politikasının birbirine sıkı bağlı birkaç bileşende ayrı ayrı yeniden yazılmak yerine tensör yaşam döngüsü katmanında bir kez ifade edilebilmesi. Bu, önbellek konumuna göre yönlendirme, model ağırlıklarını yeniden kullanma veya ilişkili durumları aynı yere yerleştirme gibi bileşenler arası politikaların denenmesini kolaylaştırıyor. 1
Araştırmacılar TensorCast'ı vLLM ve SGLang ile entegre etti. Testlerde ağırlıkların bellekte kullanılabilir hâle getirilmesi, ağırlık senkronizasyonu, KV Cache yönetimi ve programlanabilir istek yönlendirme senaryoları değerlendirildi. 1
Bu sonuçlar TensorCast'ın esnek ve durum bilgili yapay zekâ altyapıları açısından neden önem taşıyabileceğini gösteriyor: Model örneklerinin hızlı başlatılması, KV Cache konumunu dikkate alan yönlendirme ve taşıma ile tensör durumlarının yeniden kullanımı, tek tek çerçevelere özel optimizasyonlar yerine programlanabilir sistem politikaları olarak ele alınabiliyor.
Bununla birlikte söz konusu rakamlar, araştırmacıların bir araştırma ön baskısında paylaştığı deney sonuçları. Bu nedenle bağımsız tekrarlar ve üretim ölçeğinde doğrulama yapılmadan TensorCast'ın tüm gerçek dünya iş yüklerinde aynı kazanımları sağlayacağı söylenemez. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
TensorCast, tensör durumlarının konumunu, taşınmasını, dönüştürülmesini, paylaşılmasını ve belleğe alınmasını yöneten dağıtık bir Tensor as a Service (TaaS) katmanı olarak tasarlanıyor.
TensorCast, tensör durumlarının konumunu, taşınmasını, dönüştürülmesini, paylaşılmasını ve belleğe alınmasını yöneten dağıtık bir Tensor as a Service (TaaS) katmanı olarak tasarlanıyor. Sistem; model ağırlıkları, KV Cache blokları ve ara durumları hesaplama, ağ ve depolama bileşenlerinden ayırarak farklı optimizasyonların birlikte uygulanmasını hedefliyor.
Araştırmacıların testlerinde Qwen3 235B A22B örneğinde model başlatma süresi dağıtık dosya sistemlerine kıyasla 228,6 kata kadar hızlandı; yüksek eşzamanlı çok turlu ajan iş yüklerinde medyan ilk belirteç süresi yüzde...