训练数据集包含超过 1,000,000 小时的以自我为中心(第一人称)的人类视频——这大致相当于 170 年连续的清醒经历 。视频内容涵盖了烹饪、折叠、组装、清洁等日常操作任务 。预训练阶段完全没有使用机器人动作数据;机器人数据仅在少量后训练或微调阶段引入,通常每个任务不超过 10 小时 。
在预训练中,DYNA-2 采用了视频预测目标——即从过去的观察中学习预测未来的视频帧——并结合了一个视频协同训练算法,该算法同时学习视觉表征和动作预测 。这种方法与 DYNA-1 的 VLA 架构形成对比,后者直接将感知映射到机器人动作,而不经过中间视频预测步骤 。
公司在四个数量级(从 1,000 小时到 1,000,000 小时)上展示了尺度扩展能力 。
公司在匹配的训练条件和实际部署中对 DYNA-2 与 DYNA-1 进行了直接对比。
平均归一化性能随预训练规模的扩大而单调提升:从 1,000 小时到 100 万小时,性能依次为 20% → 28% → 45% → 53%(占可达到最大值的比例)。在 100 万小时尺度上,DYNA-2 在 14 项任务中的 9 项上取得了最强的实际世界性能 。关键任务级提升包括:
Dyna Robotics 报告称,这是 “首个完全由人类数据驱动的机器人尺度定律” 。其主要特征包括:
公司明确指出,这是 “首开先河” 的证明,表明扩展人类观察数据(而非机器人动作数据)可以成为提升物理机器人智能的可靠途径 。
如果这些说法经得起独立验证,Dyna Robotics 便展示了一条实用路径:无需受限于收集昂贵的机器人动作数据这一瓶颈,即可扩展机器人智能。人类视频的存在规模几乎是无限的。公司表示已在着手准备 1000 万小时的训练数据,这将使机器人仅需数小时本地微调即可掌握新的物理任务 。