L'ensemble d'entraînement était composé de plus d'un million d'heures de vidéo égocentrique (à la première personne) — l'équivalent d'environ 170 ans d'expérience éveillée continue . Les vidéos capturaient des tâches de manipulation quotidiennes telles que cuisiner, plier, assembler et nettoyer . Aucune donnée d'action robotique n'a été utilisée lors du pré-entraînement ; les données robotiques n'ont été introduites que lors d'une petite phase de post-entraînement ou de réglage fin, typiquement 10 heures ou moins par tâche .
Pendant le pré-entraînement, DYNA-2 a utilisé un objectif de prédiction vidéo — apprendre à prédire les images vidéo futures à partir d'observations passées — combiné à un algorithme de co-entraînement vidéo qui apprend conjointement les représentations visuelles et la prédiction d'actions . Cette approche contraste avec l'architecture VLA de DYNA-1, qui mappe directement la perception aux actions du robot sans prédiction vidéo intermédiaire .
La société a démontré un passage à l'échelle sur quatre ordres de grandeur, de 1 000 heures jusqu'à 1 000 000 d'heures de données de pré-entraînement .
La société a effectué des comparaisons directes en tête-à-tête entre DYNA-2 et DYNA-1 dans des conditions d'entraînement identiques et des déploiements réels.
La performance normalisée moyenne a augmenté de façon monotone avec l'échelle de pré-entraînement : 20 % → 28 % → 45 % → 53 % du maximum atteignable à mesure que les données passaient de 1k → 10k → 100k → 1M heures . À l'échelle de 1M heures, DYNA-2 a obtenu les meilleures performances réelles sur 9 des 14 tâches . Les améliorations clés par tâche comprenaient :
Dyna Robotics a rapporté ce qu'elle appelle « la première véritable loi de passage à l'échelle en robotique alimentée entièrement par des données humaines » . Caractéristiques principales :
La société déclare explicitement qu'il s'agit d'une démonstration « une première en son genre » que l'augmentation des données d'observation humaines, et non des données d'action robotique, peut servir d'axe fiable pour améliorer l'intelligence robotique physique .
Si les affirmations sont vérifiées de manière indépendante, Dyna Robotics a montré une voie pratique pour passer à l'échelle l'intelligence robotique sans le goulot d'étranglement de la collecte coûteuse de données d'action robotique. Les vidéos humaines existent à une échelle effectivement illimitée. La société déclare travailler déjà vers 10 millions d'heures de données d'entraînement, ce qui permettrait aux robots de maîtriser de nouvelles tâches physiques avec seulement quelques heures de réglage fin local .