Omega 0 係一個統一嘅 whole body world action model,目標係令機械人可以同時行路、調整姿勢、控制視角同埋操作物件。 模型分三個階段訓練:先將全身動作壓縮成 action latents,再融合視覺、語言同本體感覺預測未來視覺特徵,最後用真實家居數據做 grounding 同微調。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Omega-0, the whole-body latent-prediction world action model released on August 21, 2026 by researchers from Nanyang Technological U. Article summary: Omega-0 (ω-0) is a single, whole-body “world action model” for humanoid robots: it takes a language instruction, visual observations, and robot state, predicts a future visual representation, then generates controller-co. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wate
Omega-0(ω-0)係一個畀人形機械人使用嘅統一 whole-body world action model。簡單講,佢唔會將「行路」同「拎嘢、用手做事」當成兩個完全獨立嘅問題,而係嘗試用同一個 policy 協調機械人嘅底盤移動、身體姿勢、視線同鏡頭角度、平衡,以及雙手操作。 1
呢個方法嘅核心唔係一開始就生成一條好長、預先寫死嘅動作軌跡,而係先預測機械人做完某個動作之後,將來會睇到嘅視覺特徵。模型再根據呢個預測,揀出比較配合嘅下一步動作。換句話講,機械人唔只係諗「點樣郁先至做到」,亦會諗「郁完之後,環境應該變成點」。目前結果來自研究論文,應該視為作者嘅研究聲稱,而唔係已經由獨立機構確認嘅 benchmark 結果。 1
首先,研究團隊用 Whole-Body FAST tokenizer,將維度好高嘅全身動作軌跡壓縮成較精簡嘅 action tokens 或 latents。咁樣可以用更易處理嘅形式,表示雙腳、軀幹同雙手同時郁動嘅複雜動作。 1
同一時間,團隊將 Qwen3-VL-2B-Instruct vision-language backbone 調整到機械人環境使用。訓練時加入可學習 tokens,用嚟分辨兩種視角:
咁樣做嘅好處係,模型訓練期間可以利用外部相機提供嘅較廣闊視野,但真正執行任務時,仍然可以主要靠機械人自己嘅鏡頭作判斷。 1
第二階段採用受 V-JEPA 啟發嘅 latent prediction 目標。模型會將視覺資訊、語言指令,同埋 proprioception——即係機械人感知自己關節、姿勢同身體狀態嘅數據——融合起來,預測未來嘅 visual features,而唔係逐個像素重建未來畫面。 1
之後,diffusion transformer 會根據呢啲預測出嚟嘅表示,生成一段同機械人 controller 配合嘅 whole-body action latents。理論上,機械人揀一個動作,唔只因為嗰個動作喺運動學上做得到,亦因為預計做完之後會帶來有用嘅視覺結果。
例如,機械人可能要先行近張枱,轉動身體同鏡頭,令目標物件保持喺合適視野,再伸手拎起物件。對人類嚟講,呢啲動作通常係一氣呵成;對機械人嚟講,卻需要將移動、望向邊度、保持平衡同埋抓取協調埋一齊。 1
第三階段會將公開嘅人類示範,透過基於模擬嘅 grounding,轉移到機械人嘅 action-latent 空間。之後,系統再用人形機械人喺真實屋企執行家務嘅數據,進行 grounding 同 post-training。 1
實際執行時,Omega-0 唔會一開始就決定一項長任務由頭到尾嘅完整路線。佢會先產生一小段 action chunk,執行之後重新觀察環境,再計劃下一段動作。呢種叫做 receding-horizon 嘅方式,可以令機械人根據新嘅視覺同身體狀態資料即時修正,而唔係盲目跟住一條完全 open-loop、途中唔再更新嘅軌跡。 1
為咗訓練同評估模型,研究團隊建立咗 Omega-HOME,一個收集自真實家居環境嘅人形機械人互動數據集。數據集包括:
數據同步包含:
24 項任務再分成八類能力:
重點係,呢批任務唔係淨係對住枱面拎一件物件咁簡單。機械人可能要先移動身體,改變軀幹姿勢同視角,保持平衡,再連續處理傢俬、物件或者工具。 1
按照論文描述嘅評估流程,Omega-HOME 入面 11 種用作評估嘅任務類型,已經從訓練數據剔除。其餘機械人數據就同公開人類示範一齊,用於預訓練;真實屋企數據則用於 grounding 同 post-training。 1
呢個安排可以減低模型只係記住測試集入面相同示範嘅風險。不過,佢唔代表已經完全排除泛化問題。訓練同測試之間,仍然可能有相似房間、物件、任務結構、機械人硬件,或者數據收集方式。更嚴格嘅驗證,應該係喺全新屋企、甚至其他人形機械人平台上,由獨立團隊重現結果。
喺 11 項真實屋企 loco-manipulation 任務上,論文作者報告 Omega-0 取得 81.8% 平均成功率。佢哋強調,呢個結果係由一個統一模型完成,而唔係每項任務各自使用一套 policy、唔同 action head,或者將行路同操作分成獨立模組。 1
測試涵蓋 tabletop manipulation、清潔、洗衣、物件轉移、家電互動同 mobile manipulation 等工作。論文亦報告,Omega-0 喺呢個 test suite 入面超越咗比較對象 π-0.5、EgoVLA、GR00T-N1.7 同 ψ-0。 1
不過,現有資料未有清楚列出每個 baseline 嘅完整總體百分比。因此,較穩妥嘅講法係:Omega-0 報告咗 81.8% 成功率,並且喺該測試套件排名高過上述比較模型;就唔應該自行延伸成一個資料未提供嘅詳細數字比較。 1
Omega-0 最值得留意嘅地方,主要係架構方向。研究顯示,預測未來嘅 perceptual latents,可以成為一條橋,將人類示範、語言、視覺、proprioception 同全身機械人控制連接起來。 1
相比只學習「見到呢個畫面,就做呢個動作」,Omega-0 嘗試將動作同動作會帶來嘅下一個狀態連繫起來。對於要同時決定企喺邊度、望向邊度,以及雙手應該點做嘢嘅任務,呢種方法可能特別有用。
但 81.8% 並唔代表人形機械人已經可以喺屋企無人監督之下,長時間處理任何家務。幾個關鍵問題仍然未解決:
最準確嘅總結係:Omega-0 為人形機械人整合行走同物件操作,踏前咗重要一步。81.8% 係針對指定 benchmark 嘅強勁研究結果,但唔等於家用機械人已經準備好無人監督、通用而可靠咁處理所有家務。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Omega 0 係一個統一嘅 whole body world action model,目標係令機械人可以同時行路、調整姿勢、控制視角同埋操作物件。
Omega 0 係一個統一嘅 whole body world action model,目標係令機械人可以同時行路、調整姿勢、控制視角同埋操作物件。 模型分三個階段訓練:先將全身動作壓縮成 action latents,再融合視覺、語言同本體感覺預測未來視覺特徵,最後用真實家居數據做 grounding 同微調。
Omega HOME 包含 40.3 小時數據、4,827 個遙控操作 episodes 同 24 項家居任務;論文作者報告 Omega 0 喺 11 項真實家居 loco manipulation 任務平均成功率達 81.8%。