AgiBotは、具身操作データを300時間から3万時間へ100倍に増やすと、実機ゼロショット成功率がG1 OPで17.1%から44.1%、G2 90Dで13.4%から31.1%になったと報告している。[3][17] GE Act 2.0は汎用Web動画モデルを流用せず、視覚表現・未来状態生成・行動予測を操作データからランダム初期化で学習する世界—行動モデルだ。[17] 平均成功率だけでなく、タオルをたたむ、カップを重ねるといった小規模データでは成功しなかった技能が実行可能になったという「点灯」効果が、最大の注目点とされる。[4][8]
公開者GPT-5.6 Terra で編集GPT Image 2 で画像を生成
研究の答え

Create a landscape editorial hero image for this Studio Global article: What is AgiBot’s GE-Act 2.0 native world-action model, and how do its random-initialization training approach, 100-fold embodied-data scalin. Article summary: GE-Act 2.0 is AgiBot’s “native” world–action model: its visual representation, future-state generation, and action-prediction components are trained from random initialization on manipulation data, rather than adapting a. Topic tags: general, general web, user generated, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
GE-Act 2.0は、AgiBotが開発したロボット操作向けの**世界—行動モデル(World-Action Model)**です。特徴は、汎用のWeb動画モデルを土台にするのではなく、視覚表現、未来状態の生成、行動予測という学習可能な主要部分を、ロボット操作データからランダム初期化で訓練した点にあります。17
今回の注目点は「データを増やすと成功率が上がる」というだけではありません。AgiBotは、訓練データを300時間から3万時間へ増やしたところ、小規模データではできなかった細かな操作が実機のゼロショット評価で成功し始めた、と報告しています。4
17
ただし、これは任意の家庭、工場、ロボットで自律作業できることを証明した研究ではありません。結果は、2種類のロボットと100の原子的タスク(単位作業)から成る、同社の評価条件に基づくものです。
言語指示を受けたロボットが物を置くには、目の前の状況を理解し、成功時に近い状態を予測し、その状態へ到達するモーター制御を出す必要があります。世界—行動モデルは、この「見る・先を見通す・動かす」をつなぐ仕組みです。
GE-Act 2.0は、報告上、次の3要素で構成されます。
学習には、**KASO(Knowledge-Aligned Selective Optimization)**と呼ぶ手法を用いるとしています。論文では、視覚的な計画と行動学習を協調させつつ、補完的なデータでそれぞれを事前学習できる方式として説明されています。17
またAgiBotは、RTX 5090を1枚使った場合のアクションチャンク推論が104ミリ秒だと報告しています。5 ロボット操作では、もっともらしい計画を作れるだけでは足りません。観測と反応を繰り返すため、次の制御出力を十分に速く出せることも重要です。
多くのロボット学習では、大量の画像やWeb動画であらかじめ学習されたモデルが活用されます。一方でGE-Act 2.0は、生成・行動の学習対象コンポーネントをランダム初期化し、操作データでゼロから訓練します。17
これにより今回の実験は、既存の動画基盤モデルの効果ではなく、物理的な相互作用と行動にひも付く具身データを増やすと、操作能力がどのように変化するかを比較的明確に見る設計になっています。
報告されている学習レシピには、ロボットの遠隔操作軌跡、人間の一人称動画、ラベルなしのロールアウトデータ、失敗データなどを組み合わせられます。6
20 高品質なロボット実演の収集にはコストがかかるため、不完全なデータや成功ラベルのない相互作用データも活用できるなら、データ収集の現実性に関わる利点になり得ます。
AgiBotは、操作データを300時間、1,200時間、5,000時間、3万時間としたモデルを学習しました。最小条件から最大条件までで、データ量は100倍です。4
17
主な評価は、以下の条件による実機ゼロショット試験でした。
報告された総合成功率は、データ規模に応じて次のように向上しました。
| ロボット本体 | 300時間時の成功率 | 3万時間時の成功率 |
|---|---|---|
| G1-OP | 17.1% | 44.1% |
| G2-90D | 13.4% | 31.1% |
これらはGE-Act 2.0の研究で報告された結果です。3
17
この実験から直接言えるのは、このモデルとこのタスク分布では、具身データの増加がゼロショットの操作成功率の大幅な上昇と結び付いたということです。著者らは、5,000時間から3万時間の範囲でも明確な飽和は見られなかったとしており、さらなるスケーリングが有効な可能性を示すと解釈しています。5
平均成功率が上がっても、もともとできた作業の安定性が上がっただけかもしれません。AgiBotがより強調するのは、データ規模の拡大に伴って、成功率がゼロではないタスクそのものが増えた点です。
G1-OPでは、成功完了を記録した原子的タスク数が、300時間学習時の100件中39件から、3万時間学習時には76件へ増えたと報告されています。4
例として挙げられているのは、次のような比較的繊細な操作です。
これが論文のいう「点灯(light-up)」という表現の根拠です。報告された試行では、データ増量は既存技能の成功率向上だけでなく、小規模条件では失敗していた技能がゼロショット条件で実行可能になることとも関連していました。
とはいえ、これを「汎用知能が突然生まれた」証拠と読むべきではありません。これは有限のベンチマークにおけるタスク到達範囲の観測結果です。より多様な物体、長時間にわたる作業、安全性が重要な現場、未検証のロボット設計でも同じ傾向が続くかは、今後の検証課題です。
G2-90Dは、異なるロボット本体の間で能力がどこまで共有されるかを見る材料です。AgiBotによると、この車輪型移動マニピュレーターは共同学習データに占める割合が2%未満だったにもかかわらず、小規模条件から大規模条件にかけて総合成功率が17.7ポイント改善しました。3
17
これは、視覚や動作に関する学習内容の一部が、異なる身体構造のロボット間で共有可能であることを示す有望な結果です。将来、ロボットごとに方策を全面的に作り直す必要を減らせる可能性があります。
一方で、これはハードウェア非依存のロボット知能を確立した結果ではありません。根拠は2種類の本体と研究内のタスク分布に限られます。G2-90Dも共同学習には含まれていたため、まったくデータのない任意の新ロボットへ転移できることを示したわけでもありません。
GE-Actは、ロボット方策学習、評価、シミュレーションを単一の動画生成フレームワークで統合することを目指す、AgiBotのより広い**Genie Envisioner(GE)**プラットフォームの一部です。18
その中でGE-Actは行動志向の要素であり、GE-Simは評価や開発のために、行動条件付きロールアウトを生成する世界シミュレーション要素として位置付けられています。18
19
ここで区別すべきなのは、GE-Act 2.0の主な成果が物理ロボットでのゼロショット試験に基づくことです。GE-Simは広いプラットフォーム内の関連技術ですが、評価タスク固有のファインチューニングや実演なしに、実機で報告された操作を実行したという中心的主張の根拠そのものではありません。
AgiBotは、シミュレーション寄りのベンチマークでファインチューニングした成績も報告しています。提供された報道によると、GE-Act 2.0はRoboTwinの未知環境テストで60.52%の成功率、GenieSimの指示追従で0.770を記録し、後者は比較対象のπ0.5とGR00T N1.7を上回ったとされています。20
これらは適応性能やベンチマーク性能を測る上で有用ですが、実機ゼロショット実験とは別の問いに答える数値です。ファインチューニング後の結果を、タスク適応なしで得られた能力の根拠として扱うことはできません。
GE-Act 2.0が重要なのは、具身AIの素朴で大きな問い、すなわち「操作データだけで学んだ世界—行動モデルは、データ量に応じて予測可能に伸びるのか」を、実機評価で検証しようとした点です。
AgiBotの報告では、300時間から3万時間への拡張は、G1-OPとG2-90Dのゼロショット成功率の大幅な上昇、対応タスクの拡大、タオル折りやカップの入れ子といった細かな技能の出現と一致しました。3
4
17
適切な結論は、「万能ロボットが完成した」ではありません。統制された実機評価において、具身操作データをスケールさせることで、新しく測定可能な操作能力が現れ得ることを示す証拠です。一般的なロボット自律性の解決策とみなすには、独立した追試、より幅広いハードウェアでの評価、長時間作業と安全性に関する厳格な検証がなお必要です。
Studio Global AI
このページにはソースに裏付けされた回答が含まれており、Studio Global 内で続行できます。
AgiBotは、具身操作データを300時間から3万時間へ100倍に増やすと、実機ゼロショット成功率がG1 OPで17.1%から44.1%、G2 90Dで13.4%から31.1%になったと報告している。[3][17]
AgiBotは、具身操作データを300時間から3万時間へ100倍に増やすと、実機ゼロショット成功率がG1 OPで17.1%から44.1%、G2 90Dで13.4%から31.1%になったと報告している。[3][17] GE Act 2.0は汎用Web動画モデルを流用せず、視覚表現・未来状態生成・行動予測を操作データからランダム初期化で学習する世界—行動モデルだ。[17]
平均成功率だけでなく、タオルをたたむ、カップを重ねるといった小規模データでは成功しなかった技能が実行可能になったという「点灯」効果が、最大の注目点とされる。[4][8]