在預訓練階段,DYNA-2 採用了 影片預測目標——學習從過去的觀察預測未來的影片幀——同時結合一項 影片協同訓練演算法,共同學習視覺表徵與動作預測 。這種方法與 DYNA-1 的 VLA 架構(直接將感知映射到機器人動作,無需中間的影片預測步驟)形成鮮明對比
。
該公司在匹配的訓練條件和真實世界部署中,對 DYNA-2 與 DYNA-1 進行了直接的一對一比較。
平均正規化效能隨著預訓練規模的擴大而單調遞增:數據量從 1k → 10k → 100k → 1M 小時,效能分別達到可達到最大值的 20% → 28% → 45% → 53% 。在 100 萬小時規模下,DYNA-2 在 14 項任務中的 9 項 取得了最強的現實世界表現
。關鍵任務的提升包括: