在预训练中,DYNA-2 采用了视频预测目标——即从过去的观察中学习预测未来的视频帧——并结合了一个视频协同训练算法,该算法同时学习视觉表征和动作预测 。这种方法与 DYNA-1 的 VLA 架构形成对比,后者直接将感知映射到机器人动作,而不经过中间视频预测步骤
。
公司在匹配的训练条件和实际部署中对 DYNA-2 与 DYNA-1 进行了直接对比。
平均归一化性能随预训练规模的扩大而单调提升:从 1,000 小时到 100 万小时,性能依次为 20% → 28% → 45% → 53%(占可达到最大值的比例)。在 100 万小时尺度上,DYNA-2 在 14 项任务中的 9 项上取得了最强的实际世界性能
。关键任务级提升包括: