据彭博社报道,字节跳动正筹备一款基于 Seedance 的实时空间视频 AI 模型,张一鸣据称亲自协调跨业务资源;产品最早可能于 2026 年 10 月推出,但时间表仍可能调整。[1] 该系统据报面向直播、短剧和游戏生成可交互的虚拟世界,而不只是输出一段线性播放的视频;报道称它还能响应 Pico 用户的语音或动作输入。[7] 约 20 帧/秒和约 0.05 秒延迟是知情人士披露的说法,并非已公开、可独立验证的基准成绩。产品体验、硬件影响及商业化方式仍有待字节跳动正式公布。 [7]
发布者使用 GPT-5.6 Terra 编辑图片由 GPT Image 2 生成
研究答案

Create a landscape editorial hero image for this Studio Global article: What is known about ByteDance’s reported real-time spatial video AI model—personally overseen by founder Zhang Yiming and potentially launch. Article summary: ByteDance is reportedly developing a Seedance-based real-time spatial-video, or “world model,” that could generate interactive 3D environments rather than conventional linear video. Zhang Yiming is said to be personally . Topic tags: general, news, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
“能生成一段视频”和“能让人走进视频里、实时改变其中的世界”,是两回事。
据彭博社报道,字节跳动正在筹备一款面向实时空间视频生成的 AI 模型。它据称由创始人张一鸣亲自督导,最快可能于下个月推出;但目前发布计划仍可能变动,字节跳动也尚未公开确认该项目。 1
若报道属实,这将意味着字节跳动希望把视频生成 AI 从“做出一条成片”,推进到能持续响应用户操作的交互式三维环境——也就是业内常说的“世界模型”。
报道称,这一模型建立在字节跳动视频生成技术 Seedance 的基础上。字节跳动此前公布的信息显示,Seedance 2.0 是一个原生多模态音视频生成模型,可接收文本、图片、音频和视频作为输入。
新系统的设想并非生成固定镜头的视频片段,而是用于创建可交互的虚拟世界,潜在场景包括直播、短剧和游戏。 7 换句话说,用户移动、发出语音指令或进行互动后,场景理论上应能随之变化,而不是只能播放预先渲染好的内容。
这也是它被归入“世界模型”赛道的原因。Google DeepMind 对世界模型的解释是:系统模拟环境如何演变,以及行动会如何影响环境。其 Genie 3 被设计为可根据文本提示实时生成可交互环境。
彭博社援引知情人士称,张一鸣正在协调公司不同业务部门,并将 AI 资源和算力投入这一项目。 1
这并不等于产品已经完成,更不代表发布日期已经敲定;但若相关信息准确,创始人直接统筹意味着字节跳动可能将其视为一项平台级布局,而非给现有视频工具增加的一项功能。
彭博社将这一项目置于字节跳动与 Meta、Alphabet 竞争的背景下,并指出世界模型的潜在应用不止娱乐,还可能延伸至机器人和自动驾驶系统。 1 对普通用户而言,互动内容或许是最接近落地的方向;而从技术目标看,关键在于模型能否在用户不断操作时维持一个连贯、可用的环境。
有报道称,该模型可按需生成约 20 帧/秒的视频流,延迟约 0.05 秒,并可响应 Pico 头显用户的语音或动作输入。 7
这些数字值得关注,但不能直接当作已经被公开验证的产品能力:它们来自知情人士说法,字节跳动尚未发布可供独立核验的技术文档或测试结果。
而且,实时 XR(扩展现实)体验并不只取决于生成帧率和单项延迟。画面是否稳定、空间关系能否长期一致、网络是否可靠、端到端的动作到显示延迟,以及推理成本能否承受,都会影响最终使用感受。
云端渲染在理论上可以把部分高计算量从头显转移出去,从而降低终端硬件压力。但现在还不能据此断言该模型会降低 Pico 设备售价,或使其对 Meta、Apple 形成决定性优势。这些都只是可能的战略推演,而不是已被确认的产品结果。
“最快下个月”是基于匿名消息人士的报道。彭博社的表述是产品正在为可能的发布做准备,并非公布了固定日期。 1 其他转述报道同样指出,时间安排可能变化。
8
因此,在字节跳动正式发布前,最好将信息分成三层看待:
字节跳动拥有投入 AI 基础设施的资金能力,但这不代表所有资金都将用于这一个空间视频模型。
路透社报道,字节跳动已从近 30 家银行获得 296 亿美元贷款;知情人士称,相关资金将支持其海外 AI 扩张。该贷款额度据报从最初计划的 200 亿美元扩大。
另据彭博社报道,字节跳动曾讨论在 2026 年投入最高 700 亿美元资本开支,用于数据中心及其他 AI 基础设施。这是报道中的规划金额,并非已确认支出,也不是对该模型的专项分配。
基于 36 氪报道的消息还称,字节跳动提出在 2026 年底前至少发布一个世界模型版本,并以 Google 的 Genie 3 作为对标对象。 但这属于报道称的内部目标,不是字节跳动公开作出的承诺。
AI 视频模型可以生成有说服力的短片;但一个真正可交互的环境,需要在时间推移中保持场景连贯,还要让用户操作产生合理反馈。这正是世界模型吸引人的地方,也是最难攻克的部分。
若项目成功,字节跳动可能把视频生成能力与互动娱乐、XR 硬件进一步打通;对整个行业而言,它也会让世界模型赛道多出一位重要竞争者。
但现阶段最稳妥的结论仍然很有限:字节跳动似乎正在推进一项基于 Seedance 的实时空间视频世界模型项目,且据报获得张一鸣的直接关注。至于实际画质与交互质量、正式发布时间、对 Pico 的真实价值,都要等产品发布和可衡量的技术结果出现后才能判断。 1
7
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
据彭博社报道,字节跳动正筹备一款基于 Seedance 的实时空间视频 AI 模型,张一鸣据称亲自协调跨业务资源;产品最早可能于 2026 年 10 月推出,但时间表仍可能调整。[1]
据彭博社报道,字节跳动正筹备一款基于 Seedance 的实时空间视频 AI 模型,张一鸣据称亲自协调跨业务资源;产品最早可能于 2026 年 10 月推出,但时间表仍可能调整。[1] 该系统据报面向直播、短剧和游戏生成可交互的虚拟世界,而不只是输出一段线性播放的视频;报道称它还能响应 Pico 用户的语音或动作输入。[7]
约 20 帧/秒和约 0.05 秒延迟是知情人士披露的说法,并非已公开、可独立验证的基准成绩。产品体验、硬件影响及商业化方式仍有待字节跳动正式公布。 [7]