Omega 0(ω 0)是一个面向人形机器人的统一“全身世界动作模型”,尝试让机器人在同一策略中协调行走、调整姿态、改变视角、保持平衡并操作物体。 模型采用三阶段架构:先压缩全身动作并学习视觉—语言表示,再融合视觉、语言和本体感知预测未来视觉特征,最后通过真实家庭数据完成机器人落地与微调。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Omega-0, the whole-body latent-prediction world action model released on August 21, 2026 by researchers from Nanyang Technological U. Article summary: Omega-0 (ω-0) is a single, whole-body “world action model” for humanoid robots: it takes a language instruction, visual observations, and robot state, predicts a future visual representation, then generates controller-co. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wate
Omega-0(ω-0)是一种面向人形机器人的统一 全身世界动作模型(whole-body world action model)。它的核心目标,是不再把“走到物体旁边”和“伸手拿起物体”视为两个彼此独立的问题,而是让机器人在同一个策略中协调移动底座、调整身体姿态、改变摄像头视角、维持平衡,并完成手臂和手部操作。1
简单来说,Omega-0 并不是看到一幅画面后就直接生成一条很长、预先固定好的运动轨迹。它会先预测机器人采取动作后未来可能看到的视觉特征,再据此选择与目标相匹配的动作。相关结果来自研究论文,应视为论文作者报告的研究结论,而非已经由独立机构确认的基准结果。1
人形机器人的全身运动维度很高,同时控制腿部、躯干、手臂和手部并不容易。Omega-0 首先使用 Whole-Body FAST tokenizer,把高维的全身运动轨迹压缩成更紧凑的动作 token 或 latent 表示。这样,模型就能以更易处理的形式表达复杂动作组合,例如一边迈步、一边转动躯干并伸手取物。1
与此同时,研究人员将 Qwen3-VL-2B-Instruct 视觉—语言模型骨干适配到机器人环境中。训练时,模型使用可学习 token 区分两类视角:
这种设计让模型在训练阶段能够利用第三人称视角提供的全局监督,同时在实际运行时主要依靠机器人自身摄像头获取信息。1
第二阶段采用受 V-JEPA 启发的潜在空间预测目标。模型把视觉信息、语言指令和 本体感知(proprioception,即机器人自身关节、姿态和状态的测量数据)融合起来,预测未来的视觉特征,而不是试图逐像素重建未来画面。1
随后,一个扩散 Transformer 根据这些预测出的视觉表示,生成与机器人控制器兼容的全身动作 latent 序列。其关键思路是:机器人选择动作时,不只考虑“这个动作在运动学上是否可行”,还要考虑它可能带来的视觉结果。
例如,当目标物体位于机器人侧前方时,机器人可能需要先走近目标、调整身体朝向和摄像头视角,确认物体位置后再伸手抓取。Omega-0 试图把这些连续动作作为同一项任务中的协同过程来处理。1
在第三阶段,研究人员通过基于仿真的 grounding,将公开的人类演示迁移到机器人的动作 latent 空间中。之后,模型再使用人形机器人在真实家庭环境中执行任务的数据进行微调。1
实际运行时,Omega-0 不会一次性承诺执行完整的长任务,而是采用类似“滚动时域”的方式:
这种 action chunking 机制能够让机器人根据新的视觉和本体感知信息及时修正路线,而不是像完全开环的系统那样,一旦开始就严格跟随一条固定轨迹。1
为训练和评估 Omega-0,研究团队构建了 Omega-HOME 数据集。该数据集包含 40.3 小时数据、4,827 个遥操作片段和 24 项家庭任务,数据采集频率为 30 Hz。1
数据经过同步处理,包含:
这些任务被划分为八类能力:
Omega-HOME 的重点并不只是静态桌面抓取。许多任务要求机器人移动底座、改变身体和躯干姿态、保持平衡,并在较长动作序列中操作家具、日常物品或工具。1
根据论文描述的评估方案,测试中的 11 类任务被从 Omega-HOME 的训练数据中移除。剩余的机器人数据与公开的人类演示结合,用于前期表示和动作预训练;真实家庭数据则用于机器人 grounding 和后训练。1
这种划分可以降低模型直接记住测试演示的风险,使结果更接近对任务层面泛化能力的评估。但它并不能绝对保证不存在数据重叠。训练集和测试集之间仍可能在房间布局、物体类型、任务结构、机器人硬件或数据采集方式上存在相似之处。
更严格的验证方式,是在全新的家庭环境中,并使用不同的人形机器人平台进行独立复现。
在 11 项真实家庭移动操作任务中,论文作者报告 Omega-0 达到 81.8% 的平均成功率。这一结果使用的是一个统一模型,而不是为每项任务分别训练策略,也没有将行走和操作拆成彼此独立的模块。1
测试任务覆盖桌面操作、清洁、洗衣、物体转移、家电交互和移动操作等场景。论文还报告称,在该测试套件中,Omega-0 的表现超过了对比基线 π-0.5、EgoVLA、GR00T-N1.7 和 ψ-0。1
不过,现有材料没有清楚提供每个基线模型的完整总体成功率,因此更稳妥的表述是:论文报告了 Omega-0 在该测试套件中的领先排名,以及 81.8% 这一自身成绩,而不应进一步推导出未被明确展示的详细数值差距。
Omega-0 最值得关注的贡献在于架构方向。它展示了一种可能的路径:通过预测未来的潜在视觉状态,把人类演示、语言指令、视觉输入、本体感知和人形机器人的全身控制连接起来。1
传统系统可能分别学习“看到这个画面应该如何移动”和“如何抓取这个物体”。Omega-0 则试图进一步建立动作与未来状态之间的联系:机器人要移动到哪里、应该看向哪里,以及双手最终要如何操作物体,都可以放在同一任务框架中考虑。
但 81.8% 并不意味着人形机器人已经能够在家庭中长时间、无监督地完成各种工作。至少还有几项关键难题没有解决:
因此,更准确的结论是:Omega-0 朝着统一协调人形机器人行走与操作迈出了重要一步。81.8% 是特定基准上的强劲研究结果,但还不是“家用机器人已经可以在没有监督的情况下处理任何家务”的证明。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Omega 0(ω 0)是一个面向人形机器人的统一“全身世界动作模型”,尝试让机器人在同一策略中协调行走、调整姿态、改变视角、保持平衡并操作物体。
Omega 0(ω 0)是一个面向人形机器人的统一“全身世界动作模型”,尝试让机器人在同一策略中协调行走、调整姿态、改变视角、保持平衡并操作物体。 模型采用三阶段架构:先压缩全身动作并学习视觉—语言表示,再融合视觉、语言和本体感知预测未来视觉特征,最后通过真实家庭数据完成机器人落地与微调。
Omega HOME 数据集包含 40.3 小时数据、4,827 个遥操作片段和 24 项家庭任务;在 11 项真实家庭移动操作任务中,作者报告 Omega 0 的单模型平均成功率为 81.8%。