字節跳動據報正開發一套用於即時空間影片生成嘅 AI 系統。佢唔係一般由頭播到尾、內容固定嘅影片生成器,而係一種被稱為「世界模型」嘅技術:目標係生成可探索、可互動嘅數碼環境。彭博報道指,創辦人張一鳴正親自督導項目,最快可於下月發布;但時程仍可能改變,而字節跳動亦未公開確認有關產品。
1
唔止「出片」:Seedance 之上嘅互動世界
報道指,新模型建基於字節跳動嘅影片生成技術 Seedance。字節跳動發布資料顯示,Seedance 2.0 屬多模態影音模型,可接受文字、圖片、音訊同影片作為輸入。
同生成一條固定短片唔同,呢套空間影片系統據稱可為直播、短劇同遊戲建立互動虛擬世界。
7 簡單講,用戶移動、發聲或者作出操作時,場景理論上要即時回應,而唔係只播放一段預先算好嘅畫面。
呢個亦係點解外界將項目歸入「世界模型」。Google DeepMind 對世界模型嘅描述係:系統模擬環境點樣演變,以及行動點樣影響環境;其 Genie 3 可按文字提示即時生成可探索嘅互動環境。
張一鳴親自督導,係最值得留意嘅訊號
按彭博引述知情人士所講,張一鳴正協調字節跳動多個業務部門,並將 AI 資源同運算能力投放到呢個模型。
1 呢點唔代表產品已完成,更唔等於已承諾某日推出;但如果消息屬實,創辦人親自投入,反映公司可能將之視為平台級別嘅部署,而唔只係 AI 影片工具加一項新功能。
彭博將呢項工作放入同 Meta、Alphabet 競逐嘅脈絡,並指相關技術可延伸至娛樂以外,例如機械人同自動系統。
1 近期較易想像嘅商業用途會係互動內容;更長遠嘅難題,則係令模型喺用戶改變環境後,仍可維持一個連貫、可用嘅世界。
Pico、20fps 同 50 毫秒:有報道,但未有公開驗證
有報道引述知情人士稱,模型可按需生成約每秒 20 幀嘅影片串流,延遲約 0.05 秒;系統亦可能回應 Pico 頭戴裝置使用者嘅語音或動作輸入。
7
不過,呢啲都應視為報道中嘅說法,而非公開基準測試結果。字節跳動暫未提供技術文件去獨立驗證。要做到真正好用嘅即時 XR(延展實境)體驗,除咗生成速度,畫面穩定性、空間一致性、網絡可靠度、動作到畫面顯示嘅延遲,以及推理成本,全部都會直接影響實際感受。
雲端運算理論上可以將部分算力由頭戴裝置移走,降低裝置端嘅負擔;但而家仍然太早,未能斷言此模型會令 Pico 平價啲,或者足以令 Pico 相對 Meta、Apple 有決定性優勢。呢啲只係可能嘅策略含意,未係已證實嘅產品結果。
「最快下月」唔等於已定檔
「最快下月推出」源自匿名消息人士。彭博用詞係產品正為可能推出作準備,並非公布一個固定發布日。
1 其後轉述相關消息嘅報道亦指出,時間表仍可改動。
8
喺字節跳動正式公布之前,讀者可以將資訊分開睇:
- **已報道嘅方向:**建基於 Seedance 嘅即時空間影片模型。
- **已報道嘅用途:**直播、短劇同遊戲嘅互動虛擬世界。
- **仍未驗證嘅細節:**發布時間、點樣提供使用、硬件整合方式、延遲、幀率,同幾時商業化。
背後嘅 AI 基建投入有幾大?
字節跳動有相當可觀嘅 AI 基建資源,但唔代表所有資金都專門投向呢一個模型。路透報道,公司從近 30 間銀行取得 296 億美元貸款;消息人士稱,所得資金將支持海外 AI 擴張,而貸款規模由原先目標嘅 200 億美元擴大。
另外,彭博曾報道字節跳動考慮喺 2026 年將數據中心及其他 AI 基建資本開支提高至最多 700 億美元。呢個係報道中嘅規劃數字,並非已確認支出,亦唔係某一模型嘅指定預算。
基於 36Kr 報道嘅消息亦稱,字節跳動目標喺 2026 年底前推出至少一個世界模型版本,並以 Google 嘅 Genie 3 作為對標。 呢啲屬於據報嘅內部優先事項,而唔係字節跳動對外作出嘅公開承諾。
點解值得關注?
AI 影片模型可以生成吸睛片段,但要產生可互動環境,難度高得多:系統要令場景隨時間保持連貫,又要令用戶輸入帶來合理反應。呢種能力正係世界模型最吸引人、亦最難攻克嘅地方。
如果字節跳動做得到,可能將影片生成能力連接到互動娛樂同 XR 體驗;對行業而言,亦會令 Google、Meta 主導嘅世界模型賽道多一個大型競爭者。不過,現時證據只支持一個較審慎嘅結論:字節跳動似乎正認真推進一個建基於 Seedance 嘅空間影片世界模型,而張一鳴據報亦直接參與。至於實際質素、推出日期,同對 Pico 嘅真正影響,仍要等公司發布產品同可量度嘅技術結果先有答案。
1
7