Omega 0は、ヒューマノイドロボットの歩行、姿勢、視線、腕、手を1つのモデルで協調させるwhole body world action modelです。[1] 3段階の構成により、全身動作の圧縮、視覚・言語・自己状態を使った未来の視覚特徴の予測、実環境でのロボットへの適応を行います。[1] 専用データセットOmega HOMEは、40.3時間、4,827件の遠隔操作エピソード、24種類の家庭内タスクを収録しています。[1]
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is Omega-0, the whole-body latent-prediction world action model released on August 21, 2026 by researchers from Nanyang Technological U. Article summary: Omega-0 (ω-0) is a single, whole-body “world action model” for humanoid robots: it takes a language instruction, visual observations, and robot state, predicts a future visual representation, then generates controller-co. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wate
Omega-0(ω-0)は、ヒューマノイドロボット向けの統合型 whole-body world action model です。歩行と物体操作を別々の問題として処理するのではなく、ロボットの移動、姿勢変更、視点の調整、バランス維持、手による操作を、1つの方策の中で連携させることを目指しています。1
このモデルの特徴は、動作そのものを直接生成する前に、その動作の結果としてロボットが将来どのような視覚状態になるかを予測する点にあります。たとえば、物体を取るためにロボットがまず移動し、体の向きやカメラの視点を整え、その後に手を伸ばす、といった一連の動きを同時に考えます。1
以下で紹介する性能値は、研究論文の著者らが報告した結果です。独立した第三者による検証済みベンチマークと同一視するべきではありません。1
最初の段階では、Whole-Body FAST tokenizer を使い、次元数の大きい全身軌道を、より扱いやすいaction tokenまたはlatentへ圧縮します。これにより、脚、胴体、腕、手を同時に動かす複雑な動作を、モデルが効率的に表現できるようにします。1
同時に、視覚と言語を扱う基盤モデル Qwen3-VL-2B-Instruct を、ロボットの環境に合わせて適応させます。学習時には、ロボット自身のカメラから見た一人称視点(egocentric)と、外部カメラから見た三人称視点(exocentric)を区別するlearnable tokenを利用します。1
この仕組みにより、学習中は外部カメラによる広い視野の情報も活用しながら、実際の動作時にはロボット自身のカメラを中心に判断できます。1
2段階目では、V-JEPAに着想を得たlatent predictionの学習目標を採用します。モデルは視覚情報、自然言語による指示、そしてロボットの自己状態(proprioception)を組み合わせ、将来の画像を画素単位で再構成するのではなく、未来の視覚特徴を予測します。1
その後、diffusion transformerが予測された特徴を条件として、ロボットのコントローラーが実行できる全身action latentの連続列を生成します。1
ここで重要なのは、「その場で実行できそうな動き」を選ぶだけではなく、「その動きによって、次に役立つ視覚状態へ到達できるか」を考えることです。ロボットは、対象物へ近づき、体とカメラの向きを調整し、バランスを保ちながら手を伸ばす、といった動作を一体的に計画できます。1
3段階目では、公開されている人間の実演データを、シミュレーションを使ったgroundingによってロボットのaction-latent空間へ移します。そのうえで、実際のヒューマノイドロボットが家庭内タスクを行うデータを使い、モデルを追加調整します。1
実行時の計画も、長い作業の全軌道を最初から固定する方式ではありません。Omega-0は短い action chunk を生成して実行し、再び周囲を観察してから次の動作を計画します。これはreceding-horizon方式と呼ばれ、新しい視覚情報や自己状態に応じて、動作を途中で修正できます。1
つまり、最初に作った計画を最後まで機械的に追うのではなく、「少し動く、確認する、計画し直す」を繰り返す設計です。
研究では、学習と評価のために、実環境で収集したヒューマノイドの家庭内インタラクションデータセット Omega-HOME も紹介されています。データセットは40.3時間のデータ、4,827件の遠隔操作エピソード、24種類の家庭内タスクで構成され、30Hzで記録されています。1
収録データは同期されており、次の情報を含みます。1
タスクは、次の8つの能力グループに整理されています。1
これらは、机の上にある物体を静止した状態でつかむだけのタスクではありません。ロボットは、土台ごと移動し、姿勢や胴体の向きを変え、バランスを保ちながら、家具や物体、道具を一連の動作の中で扱う必要があります。1
論文で説明されている評価手順では、評価対象となる11種類のタスクをOmega-HOMEの学習データから除外しています。残りのロボットデータは、公開された人間の実演データと組み合わせて事前学習に利用し、実際の家庭データはgroundingと追加学習に使われました。1
この分割により、テスト時に見た実演を単純に記憶しているだけなのか、それともタスクの構造に一般化できているのかを、より適切に調べられます。
ただし、これで現実世界への一般化が完全に保証されるわけではありません。訓練環境と評価環境の間で、部屋、物体、タスクの構成、使用するハードウェア、データ収集方法などに共通点が残る可能性はあります。より厳しい検証には、新しい住宅や別のヒューマノイドプラットフォームを使った独立再現が必要です。
研究チームは、11種類の実家庭loco-manipulationタスクにおいて、Omega-0が平均81.8%の成功率を達成したと報告しています。ここでいう単一モデルとは、タスクごとに別の方策を用意したり、歩行と操作を別々のモジュールに分けたりせず、1つのモデルで実行したことを意味します。1
評価には、机上での操作、清掃、洗濯物の扱い、物体の移動、家電とのインタラクション、移動を伴う操作などが含まれます。1
また論文では、このテストスイートにおいて、Omega-0が比較対象の π-0.5、EgoVLA、GR00T-N1.7、ψ-0 を上回ったと説明されています。1
一方、利用できる資料からは、各ベースラインの正確な総合成功率を十分に確認できません。そのため、現時点で安全に言えるのは、論文が報告した順位とOmega-0の81.8%という数値です。各モデルの差を、未提示の細かな数値まで推測して比較するべきではありません。1
Omega-0の意義は、単一のモデルで「どこへ移動するか」「何を見るか」「手をどう使うか」を結び付ける、アーキテクチャ上の方向性を示した点にあります。未来の視覚的なlatentを予測することで、人間の実演、言語指示、ロボットの自己状態、全身制御をつなぐ役割を担わせています。1
従来のように「この画像を見たら、この動作をする」と対応付けるだけではなく、「この動作をすれば、次にどのような状態になるか」を考える構成です。歩きながら対象を見つけ、体の向きを整え、バランスを取り、両手で操作する必要がある家庭内作業では、こうした統合が特に重要になります。
ただし、81.8%という結果は、ヒューマノイドがすでに家庭で自由に働けることを意味しません。残された課題は大きく、少なくとも次の点が挙げられます。
最も正確な見方をすれば、Omega-0は、ヒューマノイドの移動と操作を統合するうえで重要な研究上の一歩です。81.8%は、このベンチマークにおける強い成果ではありますが、ロボットが監督なしであらゆる家庭内作業を安定してこなせることの証明ではありません。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
Omega 0は、ヒューマノイドロボットの歩行、姿勢、視線、腕、手を1つのモデルで協調させるwhole body world action modelです。[1]
Omega 0は、ヒューマノイドロボットの歩行、姿勢、視線、腕、手を1つのモデルで協調させるwhole body world action modelです。[1] 3段階の構成により、全身動作の圧縮、視覚・言語・自己状態を使った未来の視覚特徴の予測、実環境でのロボットへの適応を行います。[1]
専用データセットOmega HOMEは、40.3時間、4,827件の遠隔操作エピソード、24種類の家庭内タスクを収録しています。[1]