Omega 0(ω 0)是一個面向人形機器人的單一 whole body world action model,試圖在同一項任務中協調腳部、軀幹、相機、手臂與手掌的動作。 其三階段架構包括:以 Whole Body FAST tokenizer 壓縮全身動作並學習視覺語言表徵;融合視覺、語言與本體感覺,預測未來 visual latents;再透過模擬 grounding 與真實家庭資料進行微調。
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Omega-0, the whole-body latent-prediction world action model released on August 21, 2026 by researchers from Nanyang Technological U. Article summary: Omega-0 (ω-0) is a single, whole-body “world action model” for humanoid robots: it takes a language instruction, visual observations, and robot state, predicts a future visual representation, then generates controller-co. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wate
Omega-0(ω-0)是一個為人形機器人設計的單一 whole-body world action model。它不把「走路」與「拿東西」視為兩個互不相干的問題,而是嘗試在同一個策略中協調機器人的移動、姿勢、視角、平衡,以及手臂和手掌的操作。換句話說,機器人不只是伸手抓取物件,也能先走到合適位置、調整身體與攝影機方向,再完成操作。 1
這套方法的核心不是直接輸出一條預先規劃好的長途徑,而是先預測某個動作將帶來的未來視覺狀態。模型會估計機器人完成一個動作後可能「看到什麼」,再據此選擇彼此相容的全身動作。以下結果來自研究團隊的論文,應理解為作者所報告的研究主張,而非已由獨立機構確認的 benchmark 結果。 1
人形機器人的全身動作維度很高,腳部、軀幹、手臂和手掌往往需要同時配合。Omega-0 首先透過 Whole-Body FAST tokenizer,把高維度的全身動作軌跡壓縮成較精簡的 action tokens 或 latents。這讓模型能以較容易處理的形式表示「邊走邊轉身、保持平衡並伸手」等複合動作。 1
同一階段也會將 Qwen3-VL-2B-Instruct 視覺語言骨幹調整至機器人環境。研究人員加入可學習的 viewpoint tokens,用來區分:
這種設計讓模型在訓練時能利用外部攝影機提供的全局資訊,但在實際部署時,仍可主要依靠機器人自身的視角運作。 1
第二階段採用受 V-JEPA 啟發的 latent prediction 目標。模型把視覺資訊、語言指令與 proprioception(本體感覺,也就是機器人對自身關節、姿態與狀態的量測)融合起來,預測未來的 visual features,而不是逐一重建未來畫面的每個像素。 1
接著,diffusion transformer 會根據這些預測出的未來視覺表示,生成一段與機器人控制器相容的 whole-body action latents。其背後邏輯是:一個動作不只要在運動學上可行,也應該能把機器人帶到有用的視覺狀態。
例如,當指令要求機器人拿取桌上的物件時,模型可能需要同時考慮:先移動到桌邊、調整身體朝向、讓相機取得更好的視線,最後才伸手抓取。這種「動作會把我帶到哪裡」的預測,正是 Omega-0 想處理的協調問題。 1
第三階段先透過基於模擬的 grounding,把公開的人類示範轉移到機器人的 action-latent 空間,之後再使用人形機器人在真實家庭環境執行家務的資料進行微調與後訓練。 1
在實際執行時,Omega-0 不會一開始就鎖定整段長任務的完整路徑。它會先產生一小段 action chunk,執行後重新觀察環境,再規劃下一段動作。這種 receding-horizon,也就是滾動時域的方式,讓機器人能根據最新的影像和本體感覺資訊修正路徑,而不是像 open-loop 系統一樣從頭到尾照著固定軌跡走。 1
為了訓練和評估模型,研究團隊建立了 Omega-HOME,一個由人形機器人在真實家庭環境中收集的互動資料集。資料集包含 40.3 小時資料、4,827 個遙操作情節,以及 24 項家庭任務,以 30 Hz 錄製。 1
資料同步包含:
24 項任務分成八類能力:
這些任務並不只是固定在桌面前抓取物品。機器人還必須移動底座、調整站姿與軀幹、維持平衡,並在較長的動作序列中操作家具、物件或工具。 1
按照論文所描述的評估流程,Omega-HOME 中的 11 類評估任務被排除在 Omega-HOME 的訓練資料之外。其餘機器人資料則與公開的人類示範結合,用於預訓練;真實家庭資料再用於 grounding 與後訓練。 1
這種資料切分能降低模型只是記住測試示範的風險,讓結果更接近任務層級的泛化能力。不過,它並不能完全保證模型已具備現實世界的泛化能力。訓練與測試之間仍可能存在房間、物件、任務結構、硬體或資料收集方式的相似性。
更嚴格的驗證方式,會是在全新的住宅環境,以及不同型號的人形機器人平台上進行獨立複製測試。
在 11 項真實家庭 loco-manipulation 任務中,研究團隊報告 Omega-0 達到 81.8% 平均成功率。測試採用單一整合模型,而不是每項任務各自使用不同策略、不同 action head,或把行走與操作拆成獨立模組。 1
測試涵蓋桌面操作、清潔、洗衣、物件轉移、家電互動與移動式操作等情境。論文也表示,在這個測試套件中,Omega-0 的表現優於比較的 baseline,包括 π-0.5、EgoVLA、GR00T-N1.7 與 ψ-0。 1
目前提供的資料未清楚列出每個 baseline 的完整總體百分比,因此較穩妥的解讀是:研究論文報告了 Omega-0 的 81.8% 數字與其在該測試套件中的領先排名,而不應延伸成資料未呈現的詳細數值比較。
Omega-0 的主要價值在於架構方向,而不只是單一成功率數字。它展示了一種可能的路徑:以未來感知 latent 的預測,連結人類示範、語言、視覺、本體感覺與人形機器人的全身控制。 1
傳統上,模型可能只學習「看到這個畫面時,應該做什麼動作」。Omega-0 則進一步嘗試把動作與動作完成後的狀態連結起來。對需要同時決定「站在哪裡、看向哪裡、如何使用雙手」的任務而言,這種思路尤其重要。
但 81.8% 並不代表人形機器人已準備好在家庭中長時間、無人監督地執行任何家務。幾項關鍵挑戰仍未解決:
更精確地說,Omega-0 是朝向「整合人形機器人的行走與操作」邁出的重要研究一步。81.8% 是其在特定 benchmark 上的強勁研究結果,但還不能當作家用機器人已能在沒有監督的情況下可靠處理各種家務的證明。
Studio Global AI
這個頁面包含附來源佐證的答案,你可以在 Studio Global 內繼續追問。
Omega 0(ω 0)是一個面向人形機器人的單一 whole body world action model,試圖在同一項任務中協調腳部、軀幹、相機、手臂與手掌的動作。
Omega 0(ω 0)是一個面向人形機器人的單一 whole body world action model,試圖在同一項任務中協調腳部、軀幹、相機、手臂與手掌的動作。 其三階段架構包括:以 Whole Body FAST tokenizer 壓縮全身動作並學習視覺語言表徵;融合視覺、語言與本體感覺,預測未來 visual latents;再透過模擬 grounding 與真實家庭資料進行微調。
Omega HOME 包含 40.3 小時資料、4,827 個遙操作情節與 24 項家庭任務,提供同步語言指令、第一人稱與第三人稱影像、深度、機器人狀態及全身動作資料。