訓練數據集包含 超過 100 萬小時的第一人稱(自我中心)人類影片——相當於約 170 年的連續清醒經驗 。這些影片記錄了日常的操作任務,例如烹飪、折疊、組裝和清潔 。預訓練階段完全未使用機器人動作數據;機器人數據僅在少量後訓練或微調階段引入,通常每個任務不超過 10 小時 。
在預訓練階段,DYNA-2 採用了 影片預測目標——學習從過去的觀察預測未來的影片幀——同時結合一項 影片協同訓練演算法,共同學習視覺表徵與動作預測 。這種方法與 DYNA-1 的 VLA 架構(直接將感知映射到機器人動作,無需中間的影片預測步驟)形成鮮明對比 。
該公司展示了從 1,000 小時到 100 萬小時,橫跨 四個數量級 的縮放表現 。
該公司在匹配的訓練條件和真實世界部署中,對 DYNA-2 與 DYNA-1 進行了直接的一對一比較。
平均正規化效能隨著預訓練規模的擴大而單調遞增:數據量從 1k → 10k → 100k → 1M 小時,效能分別達到可達到最大值的 20% → 28% → 45% → 53% 。在 100 萬小時規模下,DYNA-2 在 14 項任務中的 9 項 取得了最強的現實世界表現 。關鍵任務的提升包括:
Dyna Robotics 報告稱,他們觀察到了所謂的 「首個完全由人類數據驅動的機器人領域真正縮放定律」 。主要特徵如下:
該公司明確表示,這是一項 「首創」 的展示,證明擴大人類觀察數據(而非機器人動作數據)可以成為提升實體機器人智慧的可靠途徑 。
如果這些主張經得起獨立驗證,那麼 Dyna Robotics 便為擴展機器人智慧展示了一條實用路徑,得以繞過收集昂貴機器人動作數據的瓶頸。人類影片的規模實際上是無限的。該公司表示,他們已在朝著 1,000 萬小時的訓練數據邁進,這將使機器人僅需數小時的本地微調就能掌握新的物理任務 。