事前学習コーパス:同社は1,000時間、10,000時間、100,000時間、1,000,000時間の4つの入れ子サブセットを構築。事前学習にはロボットの行動データは一切使用されていない 。事前学習後、比較的少量の実ロボットデータ(数時間~数分)でファインチューニングを行い、学習した物理的直感を特定のハードウェアに転移する
。
Dyna Roboticsは、物体操作における世界初のクロスエンボディメント転移スケーリング則を報告した 。この発見は、人間の動画データの拡大が、ロボットのパフォーマンスに予測可能で単調な改善をもたらすことを示しており、大規模言語モデルを変革したスケーリング則と同様の性質を持つ。
人間データ上のスケーリング則:4桁の規模(1K→10K→100K→1M時間)にわたり、動画予測品質の全指標が単調に改善。べき乗則によく適合し、頭打ちは観測されていない 。
未見ロボットデータへの転移則:同じチェックポイントを、2つの固定式両腕プラットフォームにおける39種類の異なるロボットタスクに対してゼロショットで評価。ロボット固有のファインチューニング前から、事前学習の人間動画プールが増えるにつれてパフォーマンスが単調に向上した 。ある分析では、行動ラベル付きデータを50,000時間で固定し、動画のみの時間を追加すると、ゼロショットのロボット行動MSE(平均二乗誤差)が0.340から0.120に低下した
。
ポストトレーニング後のパフォーマンススケーリング:ポストトレーニング後、14のロボットタスクにおける平均正規化スコアは、事前学習規模が1K時間から1M時間に増加するにつれて、達成可能最大値の20%→28%→45%→53% に上昇した 。
DYNA-2のパフォーマンス向上は、主に3つの領域で顕著に表れている:
高精度製造:DYNA-2は、ポストトレーニングデータに一切変更を加えることなく、事前学習規模の拡大のみにより、タスク成功率を約20%から80~90% に引き上げた 。これは、より多くの人間動画を見たことだけによる4倍~4.5倍の改善である。
ゼロショット顧客導入:実際の顧客サイトでは、DYNA-2は87%の品質合格率を達成。これに対し、VLAベースの前世代モデルDYNA-1は46% であり、同一のポストトレーニング予算下で41ポイントの改善となった 。同一条件下での物理的な直接比較評価では、DYNA-2はDYNA-1よりもタスクを1.55倍多く完了し、65%の対決で勝利した
。
ボトルキャップ捻り(13分のデータ):わずか13分のロボット専用デモンストレーションデータを用いて、DYNA-2は一対の5本指器用ロボットハンドを制御し、ボトルキャップを捻って開けることに適応した 。同社のテクニカルレポートでは、ロボットデータは約10分であったとし、事前学習規模が小さい場合の成功率10%から、100万時間規模では40~50%に上昇したとしている
。
DYNA-2の成果は、ロボットには膨大な量のタスク固有ロボットデータが必要であるという従来の前提に挑戦する。人間の動画からロボットのハードウェアへ転移するスケーリング則を実証したことで、Dyna Roboticsは1000万時間のトレーニングデータへの現実的な道筋を開いた。これにより、ロボットがわずか数時間の局所的なファインチューニングで新しい物理タスクを習得できる可能性が示されている 。現在、DYNA-2はベンダー運用システムとして提供されており、Dyna Roboticsは公開チェックポイント、API、ライセンスを発表していない
。ロボット研究コミュニティによる独立した再現検証が、次のステップとなるだろう
。