DYNA-2 係一個預先訓練好嘅模型,用嚟控制實體機械人。同上一代 DYNA-1 唔同,DYNA-1 係用 Vision-Language-Action(VLA)嘅架構,直接將鏡頭見到嘅影像對應返機械人嘅動作;而 DYNA-2 嘅核心係「預測未來」——佢學嘅係由過去嘅影片幀預測接下來會發生咩畫面 。Dyna Robotics 叫呢個做世界行動模型,意思係機械人會諗吓自己做咗某個動作之後會有咩後果,先至郁手。
訓練數據集包含 超過1,000,000小時嘅第一身(egocentric)人類影片——即係頭戴式鏡頭影住嘅主觀視角,大約相當於170年唔停咁清醒嘅經驗 。呢啲影片記錄咗日常嘅操作任務,例如煮嘢食、摺衫、裝嵌同清潔等 。喺預訓練階段完全冇用過任何機械人動作數據;機械人數據只係喺後期一個好細嘅微調階段先用,每個任務通常只需要10小時或更少嘅機械人數據 。
預訓練期間,DYNA-2 用嘅係 「影片預測」目標——由過去嘅觀察預測未來嘅影片幀——再配合一個 「影片共同訓練」演算法,同時學習視覺表徵同動作預測 。呢個做法同 DYNA-1 嘅 VLA 架構好唔同,後者直接由影像映射到動作,中間冇經過影片預測嘅步驟 。
公司仲展示咗由 1,000小時到1,000,000小時 四個數量級嘅Scaling效果 。
Dyna Robotics 喺相同訓練條件下,直接將 DYNA-2 同 DYNA-1 喺真實世界進行面對面比較。
平均標準化表現隨住預訓練規模單調上升:數據由 1千小時 → 1萬小時 → 10萬小時 → 100萬小時,表現由 20% → 28% → 45% → 53%(可達到嘅最高分數)。喺100萬小時嘅規模下,DYNA-2 喺14項任務中有 9項 做出最好嘅真實世界表現 。關鍵任務嘅進步包括:
Dyna Robotics 話呢個係 「第一個完全由人類數據驅動嘅機械人真正Scaling Law」 。幾個關鍵特徵:
公司明確指出,呢個係 「前所未有」 嘅證明——用大量人類觀察數據(而唔係機械人動作數據)可以成為一條可靠嘅軸線,嚟提升實體機械人嘅智能 。
如果呢啲聲稱能夠經過獨立驗證,Dyna Robotics 就展示咗一條實際可行嘅路徑:要Scale機械人智能,唔一定要收集又貴又難搞嘅機械人動作數據。人類影片嘅供應量基本上係無限咁大。公司話佢哋已經計劃緊走向1,000萬小時嘅訓練數據,到時機械人只需要幾個鐘嘅本地微調,就可以掌握全新嘅體力任務 。