本記事では、DYNA-2の仕組み、学習方法、実証された性能そしてスケーリング則の詳細を解説します。
DYNA-2は、物理ロボットを制御するための事前学習済みモデルです。前世代のDYNA-1が「視覚-言語-行動(VLA)」アーキテクチャを採用し、知覚を直接ロボット動作にマッピングしていたのに対し、DYNA-2は 過去の映像フレームから未来の映像フレームを予測する ことで動作を学習します 。
同社はこのアプローチを「世界行動モデル」と呼びます。ロボットが動く前に、その行動がもたらす結果(世界の変化)を推論するからです 。
DYNA-2の事前学習に使用されたデータセットは、100万時間を超える 人間の主観(一人称)視点の動画です。これは、人間の覚醒状態で約170年分の連続した経験に相当します 。動画には、調理、折りたたみ、組立、掃除など日常的な操作タスクの映像が含まれています 。
特筆すべき点として、事前学習中はロボットの動作データを一切使用していません。ロボットデータが登場するのは、ごく小規模な「ポストトレーニング(微調整)」段階のみで、タスクあたり10時間以下のデータしか使われていません 。
事前学習では、DYNA-2は 「映像予測目的」 を使用します。これは過去の観察から未来の映像フレームを予測することを学習するものです。さらに、視覚表現と行動予測を同時に学習する 「映像共訓練アルゴリズム」 を組み合わせています 。
このアプローチは、DYNA-1のVLAアーキテクチャとは明確に異なります。DYNA-1は、中間的な映像予測を介さず、知覚を直接ロボット動作にマッピングする方式でした 。
同社は、学習データの規模を1,000時間から100万時間までの 4桁(4オーダー) にわたって変化させ、性能の変化を追跡しました 。
平均正規化性能は、事前学習データ量の拡大に伴い単調に向上しました。データ規模を1千時間→1万時間→10万時間→100万時間と拡大するにつれ、達成可能な最大値に対する割合は 20%→28%→45%→53% と上昇しました 。
100万時間のスケールでは、DYNA-2は 14タスク中9タスク で最高の実世界性能を達成しました 。主要なタスクレベルの改善例は以下の通りです。
Dyna Roboticsは、これを 「ロボティクス分野で初めて、人間のデータのみで実証された真のスケーリング則」 と表現しています 。その主な特徴は以下の通りです。
人間の主観動画の事前学習量を4桁(1千時間→100万時間)にわたって増やすにつれ、学習中に一度も見せたことのないロボットハードウェア上での性能が、予測可能な形で、単調に、対数線形的に向上するというパターンを確認しました。同社はこれをスケーリング則と特定しています 。
このスケーリング則は、事前学習中にモデルが一度も触れたことのない2つの異なるロボットプラットフォーム(固定式両腕プラットフォームと半人型プロトタイプ)でも成立しました 。
人間の動画データを増やすことで、訓練時に一切提示されなかった 「未見のロボット映像データ」に対する動作予測能力も向上しました 。
同社は、ロボット行動データではなく、人間の観察データをスケールすることが、物理ロボットの知能を向上させるための信頼できる軸となり得ることを示した、と明言しています 。
もしこれらの主張が独立した検証で確認されれば、Dyna Roboticsはロボット知能のスケーリングにおける実用的な道筋を示したことになります。高価で入手困難なロボットの動作データを大量に集めるというボトルネックから解放され、事実上無制限に存在する人間の動画データを活用できるからです。同社はすでに次なる目標として1000万時間の訓練データを視野に入れており、これによりロボットは新しい物理的タスクを、わずか数時間の局所的な微調整で習得できるようになるとしています 。
※本記事の内容は2026年8月の発表時点の情報に基づきます。