彭博報導稱,字節跳動正籌備一款用於即時空間影片生成的 AI 模型,最快可能在 2026 年 10 月推出,但時程仍可能變動。[1] 報導指模型以 Seedance 為基礎,可用於直播、短劇與遊戲的互動式虛擬世界;20 fps、約 0.05 秒延遲及 Pico 互動均屬消息人士說法,尚非公開測試結果。[7] 這項計畫被視為「世界模型」競賽的一環:目標不是產生單向播放的短片,而是持續生成並回應使用者行動的可探索環境。[25]
發布者使用 GPT-5.6 Terra 編輯圖片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is known about ByteDance’s reported real-time spatial video AI model—personally overseen by founder Zhang Yiming and potentially launch. Article summary: ByteDance is reportedly developing a Seedance-based real-time spatial-video, or “world model,” that could generate interactive 3D environments rather than conventional linear video. Zhang Yiming is said to be personally . Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
字節跳動據報正開發一套用於即時空間影片生成的 AI 系統。它的概念不只是輸出一段從頭播到尾的影片,而是生成可移動、可互動的數位場景:當使用者改變位置、發出語音指令或採取動作時,畫面與場景理論上也要跟著回應。
彭博報導,創辦人張一鳴正親自督導此案、協調各事業單位,並將 AI 資源與算力投向模型;產品最快可能在下個月推出,但字節跳動尚未公開確認專案或發表日期。1
據報,這套空間影片模型建構於字節跳動既有的 Seedance 影片生成技術之上。7 字節跳動公布的資料指出,Seedance 2.0 是原生多模態影音生成模型,可接受文字、圖片、音訊與影片作為輸入。
傳聞中的新系統,則瞄準直播、短劇與遊戲所需的互動式虛擬世界。7 換句話說,關鍵不在於單一畫面是否逼真,而在於人在場景中探索或互動時,系統能否持續維持世界的樣貌、空間關係與變化邏輯。
這也是它被歸入「世界模型」的原因。Google DeepMind 對世界模型的解釋是:系統能模擬環境如何演變,以及行動會如何影響環境;其 Genie 3 也主打由文字提示即時生成可探索的互動環境。
若報導屬實,張一鳴不僅參與開發,更在跨部門協調與算力資源配置上親自推動。1 這並不代表產品已完成,更不等於發表已成定局;但創辦人層級的投入,顯示字節跳動可能將它視為平台級布局,而非單純替影片生成工具新增一項功能。
彭博將這項工作放在字節跳動與 Meta、Alphabet/Google 的競爭脈絡下,並指出世界模型潛在用途可延伸至機器人與自動化系統。1 對一般使用者而言,娛樂內容與沉浸式互動可能是最容易看見的落地場景;更長遠的技術目標,則是讓模型能在使用者行動改變情況下,持續維持一個可用的環境。
另有報導引述知情人士稱,模型可按需生成約 20 fps 的影片串流,延遲約 0.05 秒(50 毫秒),並可回應 Pico 頭戴裝置使用者的語音或動作輸入。7
但這些數字是媒體轉述的說法,不是字節跳動公布的基準測試或技術文件,因此不能直接視為已獨立驗證的產品規格。
即使生成速度接近這些數字,實際 XR 體驗仍取決於更多條件,包括:
若採雲端運算與串流方式,理論上可把部分繁重運算移出頭顯,降低裝置端的負擔;不過,現階段沒有足夠公開證據可證明它會降低 Pico 的硬體售價,或因此在與 Meta、Apple 的 XR 競爭中取得決定性優勢。這些是可能的策略推論,不是已確認的產品成果。
報導中的時間說法是「最快下個月」,並非固定發布日。彭博的措辭是字節跳動正為可能推出作準備,且消息人士明確表示計畫仍可能調整。1 後續轉述報導也保留了時程可能變動的條件。
8
在官方公告前,可把資訊分成三類:
字節跳動確實具備強大的 AI 基礎設施投入能力,但不能把相關融資或資本支出直接視為這個空間影片模型的專屬預算。
路透報導,字節跳動已從近 30 家銀行取得 296 億美元貸款;知情人士稱,款項將支援其海外 AI 擴張,融資規模也從原先目標的 200 億美元增加。 另據彭博報導,公司曾討論在 2026 年投入最高 700 億美元資本支出,用於資料中心及其他 AI 基礎設施;這是報導中的規畫數字,並非已確認支出,亦非針對單一模型的配置。
以 36Kr 報導為基礎的消息則稱,字節跳動設定在 2026 年底前至少推出一個世界模型版本,並以 Google Genie 3 為對標目標。 同樣地,這些屬於報導所揭露的內部優先事項,不是字節跳動對外做出的正式承諾。
生成式影片可以做出令人信服的片段,但互動式環境需要更難的能力:模型必須在時間推進與使用者操作下,維持場景的一致性,並讓變化看起來合理。這正是世界模型吸引人、也最難攻克的地方。
若字節跳動成功推出成熟產品,它可能把既有的影片生成能力,延伸至互動娛樂與延展實境(XR)場景,也會讓世界模型賽道多出一個有大規模內容與運算資源支撐的競爭者。
不過,目前最穩妥的結論仍然有限:字節跳動據報正推進一個以 Seedance 為基礎的即時空間影片世界模型,且獲張一鳴直接關注;至於產品品質、發布節奏、商業可用性與對 Pico 的實際影響,仍須等待公司正式發布及可檢驗的技術結果。1
7
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
彭博報導稱,字節跳動正籌備一款用於即時空間影片生成的 AI 模型,最快可能在 2026 年 10 月推出,但時程仍可能變動。[1]
彭博報導稱,字節跳動正籌備一款用於即時空間影片生成的 AI 模型,最快可能在 2026 年 10 月推出,但時程仍可能變動。[1] 報導指模型以 Seedance 為基礎,可用於直播、短劇與遊戲的互動式虛擬世界;20 fps、約 0.05 秒延遲及 Pico 互動均屬消息人士說法,尚非公開測試結果。[7]
這項計畫被視為「世界模型」競賽的一環:目標不是產生單向播放的短片,而是持續生成並回應使用者行動的可探索環境。[25]