ByteDance được cho là chuẩn bị một mô hình AI dựa trên Seedance để tạo video không gian và thế giới ảo có thể tương tác; thời điểm ra mắt sớm nhất có thể là tháng 10/2026. Các báo cáo liên hệ công nghệ này với livestream, phim ngắn và game, cũng như kính Pico.
Đăng bởiBiên tập bằng GPT-5.6 TerraHình ảnh được tạo bằng GPT Image 2
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is known about ByteDance’s reported real-time spatial video AI model—personally overseen by founder Zhang Yiming and potentially launch. Article summary: ByteDance is reportedly developing a Seedance-based real-time spatial-video, or “world model,” that could generate interactive 3D environments rather than conventional linear video. Zhang Yiming is said to be personally . Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
ByteDance được cho là đang phát triển một hệ thống AI tạo video không gian theo thời gian thực — một dạng world model (mô hình thế giới), hướng tới việc tạo môi trường số có thể khám phá và tương tác thay vì chỉ tạo video tuyến tính. Bloomberg đưa tin nhà sáng lập Zhang Yiming đang trực tiếp giám sát dự án; sản phẩm có thể ra mắt sớm nhất vào tháng 10/2026, nhưng lịch trình vẫn có thể thay đổi và ByteDance chưa công bố chính thức. 1
Mô hình được cho là xây dựng trên Seedance, công nghệ tạo video của ByteDance. Theo tài liệu ra mắt của chính ByteDance, Seedance 2.0 là mô hình đa phương thức cho âm thanh và video, nhận đầu vào là văn bản, hình ảnh, âm thanh và video.
Điểm khác biệt của hệ thống video không gian được báo cáo là khả năng tạo thế giới ảo tương tác cho livestream, phim ngắn và game. 7 Hiểu đơn giản, thay vì một cảnh quay dựng sẵn chạy từ đầu đến cuối, môi trường này phải thay đổi theo lúc người dùng di chuyển hoặc tác động vào nó.
Đó cũng là lý do dự án được xếp vào nhóm “mô hình thế giới”. Google DeepMind mô tả world model là hệ thống mô phỏng cách môi trường diễn tiến và cách hành động làm thay đổi môi trường; Genie 3 của hãng được thiết kế để tạo môi trường tương tác từ câu lệnh văn bản theo thời gian thực.
Theo Bloomberg, Zhang Yiming đang điều phối công việc giữa các đơn vị kinh doanh của ByteDance, đồng thời ưu tiên nguồn lực AI và năng lực tính toán cho mô hình này. 1 Điều đó chưa đồng nghĩa ByteDance đã có sản phẩm hoàn chỉnh hoặc cam kết phát hành vào một ngày cụ thể. Tuy vậy, nếu thông tin chính xác, sự tham gia ở cấp nhà sáng lập cho thấy đây có thể là một nỗ lực cấp nền tảng, chứ không chỉ là tính năng mới của công cụ làm video bằng AI.
Bloomberg đặt sáng kiến này trong cuộc cạnh tranh với Meta và Alphabet/Google, với ứng dụng tiềm năng không dừng ở giải trí mà còn có robot và hệ thống tự hành. 1 Trước mắt, nội dung tương tác có thể là hướng thương mại hóa gần nhất; tham vọng kỹ thuật rộng hơn là duy trì một môi trường có thể sử dụng được khi hành động của người dùng liên tục làm nó thay đổi.
Một báo cáo dẫn nguồn tin am hiểu dự án nói mô hình có thể tạo luồng video ở khoảng 20 khung hình/giây, với độ trễ khoảng 0,05 giây. Hệ thống cũng được cho là có thể phản hồi giọng nói hoặc chuyển động của người dùng kính Pico. 7
Đây cần được xem là các tuyên bố được tiết lộ, không phải số liệu benchmark công khai đã được xác minh độc lập. Một sản phẩm XR (thực tế mở rộng) dùng được trong thực tế còn phụ thuộc vào nhiều yếu tố: độ ổn định hình ảnh, tính nhất quán không gian, độ tin cậy của mạng, độ trễ từ chuyển động đến hiển thị và chi phí suy luận AI.
Về lý thuyết, kết xuất qua đám mây có thể chuyển một phần khối lượng tính toán ra khỏi kính, từ đó giảm yêu cầu đối với phần cứng cục bộ. Nhưng hiện chưa đủ cơ sở để kết luận mô hình này sẽ làm kính Pico rẻ hơn hoặc tạo ưu thế quyết định trước Meta hay Apple. Đó là khả năng chiến lược, chưa phải kết quả sản phẩm đã được xác nhận.
Mốc “sớm nhất tháng tới” dựa trên các nguồn tin không nêu danh tính. Bloomberg cho biết sản phẩm đang được chuẩn bị cho một khả năng ra mắt, thay vì công bố ngày phát hành cố định. 1 Các báo cáo đăng lại thông tin này cũng lưu ý lịch trình có thể thay đổi.
8
Trước khi ByteDance đưa ra thông báo chính thức, nên tách bạch ba lớp thông tin:
ByteDance có nguồn lực đáng kể cho hạ tầng AI, dù đây không phải ngân sách được dành riêng cho mô hình nói trên. Reuters đưa tin công ty đã thu xếp khoản vay 29,6 tỷ USD từ gần 30 ngân hàng; theo các nguồn tin, khoản tiền này sẽ hỗ trợ mở rộng AI ở nước ngoài. Quy mô khoản vay được cho là tăng từ mục tiêu ban đầu 20 tỷ USD.
Riêng Bloomberg từng đưa tin ByteDance đang cân nhắc chi tiêu vốn lên tới 70 tỷ USD trong năm 2026 cho trung tâm dữ liệu và hạ tầng AI khác. Đây là con số trong kế hoạch được báo cáo, không phải mức chi tiêu đã xác nhận và cũng không phải khoản phân bổ riêng cho mô hình video không gian.
Các báo cáo dựa trên thông tin của 36Kr cũng cho biết ByteDance đặt mục tiêu phát hành ít nhất một world model trước cuối năm 2026 và đối chiếu hiệu năng với Genie 3 của Google. Đây là các ưu tiên nội bộ được đưa tin, không phải cam kết công khai từ ByteDance.
AI tạo video có thể tạo ra một clip thuyết phục về mặt hình ảnh. Nhưng để tạo một môi trường tương tác, hệ thống phải làm được điều khó hơn: giữ cho cảnh nhất quán theo thời gian, đồng thời khiến cảnh phản hồi hợp lý trước đầu vào của người dùng. Đây vừa là sức hấp dẫn, vừa là thách thức cốt lõi của world model.
Nếu thành công, ByteDance có thể kết nối năng lực tạo video AI với giải trí tương tác và XR. Với toàn ngành, công ty sẽ trở thành một đối thủ lớn hơn trong lĩnh vực hiện được Google và Meta theo đuổi công khai. Tuy nhiên, kết luận phù hợp nhất ở thời điểm này vẫn khá hẹp: ByteDance dường như đang theo đuổi nghiêm túc một nỗ lực world model cho video không gian dựa trên Seedance, với sự quan tâm trực tiếp được báo cáo của Zhang Yiming. Chất lượng thực tế, lịch phát hành và tác động đối với Pico vẫn cần chờ sản phẩm cùng các kết quả kỹ thuật có thể đo lường. 1
7
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
ByteDance được cho là chuẩn bị một mô hình AI dựa trên Seedance để tạo video không gian và thế giới ảo có thể tương tác; thời điểm ra mắt sớm nhất có thể là tháng 10/2026.
ByteDance được cho là chuẩn bị một mô hình AI dựa trên Seedance để tạo video không gian và thế giới ảo có thể tương tác; thời điểm ra mắt sớm nhất có thể là tháng 10/2026. Các báo cáo liên hệ công nghệ này với livestream, phim ngắn và game, cũng như kính Pico.
Nếu thành công, dự án sẽ đưa ByteDance vào cuộc đua “world model” — các hệ thống mô phỏng môi trường có thể phản hồi hành động, thay vì chỉ tạo clip video phát một chiều.