DYNA 2, le modèle d'action monde (WAM) de Dyna Robotics, a été pré entraîné sur plus d'un million d'heures de vidéo humaine en vue subjective (egocentric) — soit environ 170 ans d'expérience éveillée continue — et dém... Lors de tests réels, DYNA 2 a fait passer les taux de succès dans la fabrication de précision de...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Dyna Robotics' DYNA-2 robot foundation model, how was it trained on over one million hours of first-person human video, what "world. Article summary: Dyna Robotics' **DYNA-2** is a robot foundation model that the company calls a **World-Action Model (WAM)** — a video-prediction architecture trained on over **one million hours of egocentric (first-person) human video**. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fak
Dyna Robotics dévoile DYNA-2, un modèle qui marque un tournant fondamental dans la manière dont les robots acquièrent des compétences physiques. Plutôt que de s'appuyer sur des données de téléopération robotique coûteuses et collectées manuellement — la norme du secteur — DYNA-2 a été pré-entraîné sur plus d'un million d'heures de vidéo humaine en vue subjective (égocentrique), soit environ 170 ans d'expérience éveillée continue . Dévoilé le 10 août 2026, le modèle introduit une architecture inédite appelée World-Action Model (WAM) qui apprend à prédire comment les actions modifient le monde physique avant même qu'un robot ne bouge
.
L'architecture de DYNA-2 repose sur la génération de vidéos plutôt que sur les adaptateurs Vision-Langage-Action (VLA) qui dominaient la robotique . Pendant le pré-entraînement, le modèle poursuit un double objectif : il prédit à la fois l'image vidéo suivante et la prochaine action à partir du corpus de vidéos humaines
. Cette approche permet au modèle de construire un modèle interne de la physique du contact et du raisonnement spatial — apprenant les relations de cause à effet entre les actions et leurs conséquences physiques — qui se transfère à différentes morphologies de robots sans avoir jamais vu de robot pendant le pré-entraînement
.
Corpus de pré-entraînement : L'entreprise a constitué quatre sous-ensembles emboîtés de vidéos humaines égocentriques — 1 000, 10 000, 100 000 et 1 000 000 d'heures — sans aucune donnée d'action robotique utilisée pendant le pré-entraînement . Après cette phase, le modèle est affiné sur une quantité relativement faible de données robotiques réelles (quelques heures ou même minutes) pour transférer l'intuition physique apprise au matériel spécifique
.
Dyna Robotics affirme avoir découvert la première loi d'échelle de transfert inter-morphologie en manipulation . Ce résultat est significatif car il démontre que l'augmentation de la quantité de vidéos humaines produit des améliorations prévisibles et monotones des performances robotiques — faisant écho aux lois d'échelle qui ont transformé les grands modèles de langage.
Loi d'échelle sur les données humaines : Sur les quatre ordres de grandeur (1 000 → 10 000 → 100 000 → 1 million d'heures), toutes les métriques de qualité de prédiction vidéo se sont améliorées de manière monotone, suivant une loi de puissance avec aucun plateau observé .
La loi se transfère aux données robotiques jamais vues : Les mêmes points de contrôle ont été évalués zero-shot sur 39 tâches robotiques distinctes sur deux plateformes bimanuelles stationnaires. Les performances se sont améliorées de manière monotone à mesure que le pool de vidéos humaines de pré-entraînement augmentait, avant tout affinage spécifique au robot . Une analyse a montré qu'en maintenant les données d'action étiquetées à 50 000 heures et en ajoutant des heures de vidéo uniquement, l'erreur quadratique moyenne (MSE) de l'action robotique zero-shot passait de 0,340 à 0,120
.
Amélioration des performances après entraînement : Après l'affinage, le score normalisé moyen sur 14 tâches robotiques est passé de 20% → 28% → 45% → 53% du maximum atteignable à mesure que l'échelle de pré-entraînement augmentait de 1 000 à 1 million d'heures .
Les gains de performance de DYNA-2 sont les plus visibles dans trois domaines clés :
Fabrication de haute précision : DYNA-2 a fait passer les taux de succès d'environ 20% à 80–90% grâce à la seule augmentation de l'échelle de pré-entraînement, sans aucune modification des données d'affinage . Il s'agit d'une amélioration d'un facteur 4 à 4,5 obtenue simplement en regardant plus de vidéos humaines.
Déploiements zero-shot chez les clients : Sur des sites clients réels, DYNA-2 a atteint un taux de qualité de 87%, contre 46% pour son prédécesseur DYNA-1 basé sur VLA — une amélioration de 41 points de pourcentage à budget d'affinage égal . Lors d'évaluations physiques en confrontation directe avec des conditions d'entraînement identiques, DYNA-2 a accompli les tâches 1,55 fois plus souvent que DYNA-1 et a remporté 65% des comparaisons directes
.
Dévissage de bouchon (13 minutes de données) : Avec seulement 13 minutes de données de démonstration spécifiques au robot, DYNA-2 a été adapté pour commander une paire de mains dextres à cinq doigts afin de dévisser un bouchon de bouteille . Le rapport technique de l'entreprise précise qu'il s'agissait d'environ 10 minutes de données robotiques, l'échelle de pré-entraînement faisant passer le succès de 10% à 40-50% avec le budget complet d'un million d'heures
.
Les résultats de DYNA-2 remettent en question l'hypothèse dominante selon laquelle les robots ont besoin de grandes quantités de données robotiques spécifiques à une tâche. En démontrant une loi d'échelle qui se transfère de la vidéo humaine au matériel robotique, Dyna Robotics ouvre une voie pratique vers 10 millions d'heures de données d'entraînement — avec le potentiel de permettre aux robots de maîtriser de nouvelles tâches physiques avec seulement quelques heures d'affinage local . Le modèle fonctionne actuellement comme un système opéré par le fournisseur ; Dyna Robotics n'a annoncé aucun point de contrôle public, API ou licence pour DYNA-2
. La réplication indépendante par la communauté de recherche en robotique sera la prochaine étape pour valider ces résultats
.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
DYNA 2, le modèle d'action monde (WAM) de Dyna Robotics, a été pré entraîné sur plus d'un million d'heures de vidéo humaine en vue subjective (egocentric) — soit environ 170 ans d'expérience éveillée continue — et dém...
DYNA 2, le modèle d'action monde (WAM) de Dyna Robotics, a été pré entraîné sur plus d'un million d'heures de vidéo humaine en vue subjective (egocentric) — soit environ 170 ans d'expérience éveillée continue — et dém... Lors de tests réels, DYNA 2 a fait passer les taux de succès dans la fabrication de précision de 20% à 80 90% uniquement grâce à l'échelle de pré entraînement.
Le modèle s'est adapté au dévissage d'un bouchon de bouteille avec seulement 13 minutes de données robotiques spécifiques, faisant grimper le succès de 10% à 40 50% en augmentant la quantité de vidéos humaines d'entra...