预训练语料库:该公司构建了四个嵌套的人类第一人称视频子集——分别为1000、1万、10万和100万小时——预训练阶段未使用任何机器人动作数据。预训练后,模型只需在相对少量的真实机器人数据(数小时甚至数分钟)上进行微调,就能将学到的物理直觉迁移到特定的硬件上
。
Dyna Robotics 报告称,他们发现了操作领域中首个所谓 跨形态迁移规模定律(cross-embodiment transfer scaling law)。这一发现意义重大,因为它证明了扩展人类视频数据能带来可预测且持续增长的机器人性能提升——这与改变了大语言模型的规模定律如出一辙。
人类数据的规模定律:跨越四个数量级(1000小时 → 1万小时 → 10万小时 → 100万小时),所有视频预测质量指标都呈现单调递增,并用幂律很好地描述,未观察到平台期。
定律迁移到未见过的机器人数据:相同的模型检查点在 39个不同的机器人任务(横跨两个固定的双臂平台)上进行零样本评估。在未进行任何机器人特定微调之前,随着预训练人类视频池的增大,其性能就已单调提升。一项分析表明,将带动作标注的数据固定在5万小时,并增加纯视频小时数,零样本机器人动作的均方误差(MSE)从0.340降至0.120
。
后训练性能的规模效应:在后训练阶段,随着预训练规模从1000小时增加到100万小时,14个机器人任务的平均归一化得分从可达到最大值的 20% → 28% → 45% → 53% 逐步攀升。
DYNA-2 的性能提升在三个关键领域尤为显著:
高精度制造:仅通过增加预训练规模,DYNA-2 就将任务成功率从约 20% 提升至 80–90%,无需对后训练数据做任何改动。这相当于纯粹通过观看更多人机视频,就实现了4到4.5倍的提升。
零样本客户部署:在真实的客户现场,DYNA-2 实现了 87% 的质量合格率,而基于VLA的前代产品 DYNA-1 仅为 46%——在匹配的后训练预算下,提升了41个百分点。在具有相同训练条件的现场物理对决中,DYNA-2 完成任务的成功率是 DYNA-1 的 1.55倍,并在 65% 的对比测试中获胜
。
拧瓶盖(13分钟数据):仅用了 13分钟的机器人专用演示数据,DYNA-2 就被训练来操控一对五指的灵巧手,拧开瓶盖。该公司的技术报告澄清,实际使用的机器人数据大约为 10分钟,而在预训练规模从较小预算增加到完整的100万小时后,任务成功率从10% 提升到了40-50%
。