TensorCast là lớp Tensor as a Service (TaaS) phân tán, có thể lập trình, quản lý vị trí, di chuyển, biến đổi, chia sẻ và hiện thực hóa trạng thái tensor độc lập với công việc tính toán. Hệ thống hợp nhất cách xử lý trọng số mô hình, KV Cache và các trạng thái trung gian vốn thường bị chia cắt giữa bộ suy luận, bộ lậ...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is TensorCast, the unified programmable tensor lifecycle management layer proposed by Peking University, StepFun, and Beijing Universit. Article summary: TensorCast is a proposed “Tensor as a Service” (TaaS) layer: a distributed, programmable system for managing the identity, placement, movement, transformation, sharing, and materialization of tensor state independently o. Topic tags: general web, llm, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts
TensorCast là đề xuất về một lớp Tensor-as-a-Service (TaaS): hệ thống phân tán, có thể lập trình để quản lý danh tính, vị trí, việc di chuyển, biến đổi, chia sẻ và hiện thực hóa trạng thái tensor—độc lập với phép tính tạo ra hoặc sử dụng trạng thái đó. Về mặt kiến trúc, mục tiêu của TensorCast là thay thế các cơ chế được xây dựng rời rạc cho việc nạp trọng số, quản lý KV Cache, truyền dữ liệu qua mạng và truy cập lưu trữ bằng một giao diện điều khiển thống nhất cho hoạt động phục vụ AI động. 1
Các hệ thống mô hình ngôn ngữ lớn (LLM) không chỉ phải quản lý trọng số mô hình có tính ổn định tương đối. Chúng còn phải xử lý những khối KV Cache thay đổi liên tục trong các phiên hội thoại nhiều lượt, cùng nhiều trạng thái tensor trung gian khác. Theo cách triển khai truyền thống, các nhiệm vụ này thường bị nhúng vào những thành phần riêng biệt như engine suy luận, bộ lập lịch, cơ chế truyền mạng và backend lưu trữ. Vì vậy, việc kết hợp hoặc thay đổi chính sách tối ưu trở nên phức tạp. 1
TensorCast xem quản lý vòng đời tensor là một lớp còn thiếu trong hạ tầng LLM. Ứng dụng chỉ cần mô tả cần làm gì với trạng thái tensor; runtime sẽ lựa chọn và thực thi việc đặt dữ liệu, di chuyển, biến đổi hoặc hiện thực hóa dữ liệu trên các tài nguyên trong cụm máy. 1
Cách tiếp cận này khác với kho lưu trữ đối tượng thông thường, vốn thường coi dữ liệu là những “khối” không có cấu trúc, và cũng khác với các framework lấy tính toán làm trung tâm, chủ yếu lập lịch tác vụ thay vì quản lý toàn bộ vòng đời của trạng thái tensor. 1
Trong một stack phục vụ LLM truyền thống, khi chuyển một phiên hội thoại nhiều lượt từ instance này sang instance khác, nhà vận hành có thể phải phối hợp thay đổi bộ định tuyến yêu cầu, phần triển khai KV Cache bên trong engine suy luận và backend cache/mạng.
Với TensorCast, một chính sách có thể xác định các đối tượng tensor chứa KV Cache của phiên, yêu cầu đặt hoặc hiện thực hóa chúng tại Worker đích, rồi chuyển các yêu cầu tiếp theo tới đó. Runtime quản lý vòng đời sẽ đảm nhận việc tra cứu, truyền dữ liệu và liên kết với vùng nhớ. 1
Điểm đáng chú ý không phải là quá trình di chuyển trở nên miễn phí. Lợi ích nằm ở chỗ chính sách chỉ cần được biểu đạt một lần tại lớp vòng đời tensor, thay vì phải được triển khai lại trong nhiều thành phần phụ thuộc chặt chẽ lẫn nhau. Điều này giúp việc thử nghiệm và triển khai các chính sách liên thành phần trở nên thực tế hơn—chẳng hạn định tuyến dựa trên vị trí KV Cache, tái sử dụng trọng số hoặc đặt các trạng thái liên quan trên cùng một nơi. 1
Nhóm nghiên cứu đã tích hợp TensorCast với cả vLLM và SGLang, sau đó đánh giá các nhiệm vụ gồm hiện thực hóa trọng số, đồng bộ trọng số, quản lý KV Cache và định tuyến yêu cầu có thể lập trình. 1
Theo kết quả được báo cáo, hiệu năng quản lý KV Cache của TensorCast có tính cạnh tranh với Mooncake, một hệ thống chuyên dụng cho KV Cache, trong khi vẫn giữ khả năng xây dựng chính sách bao trùm nhiều thành phần khác nhau. 1
Với việc khởi động một instance của Qwen3-235B-A22B—mô hình có tổng cộng 235 tỷ tham số, trong đó 22 tỷ tham số được kích hoạt—bài báo báo cáo thời gian khởi động nhanh hơn tới 228,6 lần so với các hệ thống tệp phân tán phổ biến. 1
2
Trong các workload agent có mức đồng thời cao và hội thoại nhiều lượt, một chính sách TensorCast có thể lập trình được báo cáo là đã giảm tới 93,2% thời gian trung vị để tạo token đầu tiên (TTFT). TTFT là khoảng thời gian người dùng phải chờ trước khi mô hình bắt đầu trả về token đầu tiên. 1
Các kết quả này cho thấy tiềm năng của TensorCast đối với hạ tầng AI có trạng thái và khả năng mở rộng linh hoạt: khởi động mô hình nhanh, định tuyến và di chuyển dựa trên vị trí cache, cũng như tái sử dụng trạng thái tensor có thể được xử lý như những chính sách hệ thống có thể lập trình, thay vì các tối ưu hóa riêng lẻ gắn với từng framework. 1
Tuy nhiên, các con số trên là kết quả thực nghiệm do nhóm tác giả báo cáo trong một bản thảo nghiên cứu. Việc tái lập độc lập và đánh giá ở quy mô sản xuất vẫn cần thiết trước khi có thể kết luận về hiệu quả trong mọi môi trường triển khai. 1
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
TensorCast là lớp Tensor as a Service (TaaS) phân tán, có thể lập trình, quản lý vị trí, di chuyển, biến đổi, chia sẻ và hiện thực hóa trạng thái tensor độc lập với công việc tính toán.
TensorCast là lớp Tensor as a Service (TaaS) phân tán, có thể lập trình, quản lý vị trí, di chuyển, biến đổi, chia sẻ và hiện thực hóa trạng thái tensor độc lập với công việc tính toán. Hệ thống hợp nhất cách xử lý trọng số mô hình, KV Cache và các trạng thái trung gian vốn thường bị chia cắt giữa bộ suy luận, bộ lập lịch, mạng và hệ thống lưu trữ.
Kiến trúc Global Store–Worker tách mặt phẳng điều khiển khỏi mặt phẳng dữ liệu, trong đó Global Store giữ siêu dữ liệu còn Worker trực tiếp thực hiện truyền tensor.