Omega 0 est un modèle unifié d’action pour robots humanoïdes : il coordonne les jambes, le tronc, la caméra, les bras et les mains au lieu de séparer marche et manipulation. Son architecture en trois étapes compresse les mouvements du corps entier, prédit les caractéristiques visuelles futures à partir de la vision,...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Omega-0, the whole-body latent-prediction world action model released on August 21, 2026 by researchers from Nanyang Technological U. Article summary: Omega-0 (ω-0) is a single, whole-body “world action model” for humanoid robots: it takes a language instruction, visual observations, and robot state, predicts a future visual representation, then generates controller-co. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wate
Omega-0 (ω-0) est un modèle unifié d’action pour le corps entier des robots humanoïdes. Plutôt que de traiter la marche et la manipulation comme deux problèmes indépendants, il cherche à les coordonner au sein d’une même politique : le robot peut déplacer sa base, modifier sa posture et son point de vue, préserver son équilibre et utiliser ses mains dans le cadre d’une seule tâche. 1
Son idée centrale consiste à prédire les caractéristiques visuelles futures plutôt qu’à produire directement une longue trajectoire entièrement prédéfinie. En pratique, le modèle estime ce que le robot « verra » après une action, puis choisit des mouvements compatibles avec cette conséquence attendue. Les résultats présentés ici proviennent du travail de recherche de ses auteurs : il faut donc les considérer comme des résultats annoncés dans l’article, et non comme un benchmark confirmé indépendamment. 1
La première étape convertit les mouvements de haute dimension du corps entier en tokens d’action, ou représentations latentes, grâce à un tokenizer appelé Whole-Body FAST. Cette compression offre au modèle une façon plus facile à exploiter de représenter des actions complexes : déplacer les jambes, ajuster le tronc et tendre le bras, par exemple. 1
Les chercheurs adaptent également un modèle de vision et de langage Qwen3-VL-2B-Instruct à l’environnement robotique. Des tokens appris permettent de distinguer la vue égocentrée — la perspective de la caméra embarquée sur le robot — de la vue exocentrée, filmée par une caméra extérieure. Le système peut ainsi profiter d’une supervision en vue extérieure pendant l’entraînement, tout en fonctionnant depuis le point de vue du robot lors de l’exécution. 1
La deuxième étape s’inspire de l’objectif de prédiction latente de V-JEPA. Omega-0 combine les informations visuelles, l’instruction en langage naturel et la proprioception, c’est-à-dire les mesures décrivant l’état interne du robot, afin de prédire de futures caractéristiques visuelles. Il ne cherche donc pas à reconstruire chaque pixel de l’image à venir. 1
Un transformeur de diffusion exploite ensuite ces représentations prédites pour générer une séquence de latents d’action du corps entier, compatible avec le contrôleur du robot. L’objectif est de sélectionner une action non seulement parce qu’elle est mécaniquement plausible, mais aussi parce qu’elle devrait conduire à une situation visuelle utile : se déplacer, orienter le corps et la caméra, puis tendre le bras vers un objet, par exemple. 1
Dans la troisième étape, des démonstrations publiques réalisées par des humains sont transférées vers l’espace latent du robot au moyen d’un ancrage fondé sur la simulation. Le système est ensuite adapté à partir de données réelles de robots humanoïdes réalisant des tâches domestiques. 1
Lorsqu’il agit, Omega-0 ne planifie pas nécessairement toute une tâche longue d’un seul coup. Il produit un court segment d’action, l’exécute, observe à nouveau son environnement, puis ajuste son plan. Cette stratégie, appelée planification à horizon glissant (receding horizon), permet de corriger la trajectoire en fonction de nouvelles informations visuelles et proprioceptives, au lieu de suivre une trajectoire entièrement ouverte et déterminée à l’avance. 1
Pour entraîner et évaluer le modèle, les chercheurs présentent Omega-HOME, un dataset d’interactions domestiques réelles avec des robots humanoïdes. Il comprend 40,3 heures de données, 4 827 épisodes téléopérés et 24 tâches domestiques, enregistrés à 30 images par seconde. 1
Les données synchronisées incluent :
Les tâches sont réparties en huit catégories de capacités :
L’intérêt du dataset est qu’il ne se limite pas à la prise d’objets sur une table. Les robots doivent déplacer leur base, modifier leur posture et leur tronc, maintenir leur équilibre et manipuler des meubles, des objets ou des outils sur des séquences plus longues. 1
Dans le protocole décrit par l’article, les 11 types de tâches utilisés pour l’évaluation ont été retirés des données d’entraînement d’Omega-HOME. Les autres données robotiques ont été combinées avec des démonstrations humaines publiques pour le préentraînement. Des données réelles enregistrées dans des maisons ont ensuite servi à l’ancrage et à l’entraînement final. 1
Cette séparation réduit le risque que le modèle mémorise simplement les mêmes démonstrations que celles présentes dans le jeu de test. Elle ne garantit toutefois pas une généralisation parfaite : les pièces, les objets, la structure des tâches, le matériel ou les méthodes de collecte peuvent encore présenter des ressemblances entre l’entraînement et l’évaluation. La vérification la plus exigeante consisterait à reproduire ces résultats dans de nouvelles maisons et sur d’autres plateformes humanoïdes.
Sur 11 tâches réelles de locomotion et de manipulation en environnement domestique, les auteurs annoncent pour Omega-0 un taux de réussite moyen de 81,8 %. Le résultat est obtenu avec un modèle unique, plutôt qu’avec des politiques séparées pour chaque tâche, des têtes d’action distinctes ou des modules indépendants pour la marche et la manipulation. 1
Les essais couvrent notamment la manipulation sur table, le nettoyage, la lessive, le transfert d’objets, l’interaction avec des appareils et la manipulation mobile. L’article indique également qu’Omega-0 dépasse, sur ce protocole de test, les modèles comparés π-0.5, EgoVLA, GR00T-N1.7 et ψ-0. 1
Les éléments disponibles ne permettent pas de citer avec suffisamment de certitude les pourcentages agrégés exacts de chacun de ces modèles. La conclusion prudente se limite donc au classement annoncé par les auteurs et au score de 81,8 % d’Omega-0, sans extrapoler vers une comparaison numérique plus détaillée. 1
La contribution principale d’Omega-0 est architecturale. Elle propose une manière de relier les démonstrations humaines, le langage, la vision, la proprioception et le contrôle du corps entier au moyen de la prédiction de représentations perceptives futures. 1
Au lieu d’apprendre uniquement quelle action correspond à une image donnée, le modèle tente de relier chaque mouvement à l’état visuel auquel il devrait conduire. Cette approche est particulièrement pertinente pour les tâches dans lesquelles le robot doit décider simultanément où se placer, quoi regarder et comment utiliser ses mains.
Mais 81,8 % ne signifie pas que les robots humanoïdes sont prêts à fonctionner seuls et sans contrôle dans n’importe quelle maison. Plusieurs difficultés majeures restent à résoudre :
La conclusion la plus précise est donc qu’Omega-0 constitue une étape importante vers la coordination unifiée de la locomotion et de la manipulation chez les robots humanoïdes. Ses 81,8 % représentent un résultat de recherche solide sur le benchmark étudié, mais pas encore la preuve qu’un robot peut accomplir de manière fiable toute tâche domestique, sans supervision.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Omega 0 est un modèle unifié d’action pour robots humanoïdes : il coordonne les jambes, le tronc, la caméra, les bras et les mains au lieu de séparer marche et manipulation.
Omega 0 est un modèle unifié d’action pour robots humanoïdes : il coordonne les jambes, le tronc, la caméra, les bras et les mains au lieu de séparer marche et manipulation. Son architecture en trois étapes compresse les mouvements du corps entier, prédit les caractéristiques visuelles futures à partir de la vision, du langage et de la proprioception, puis adapte le modèle à des tâches do...
Le dataset Omega HOME rassemble 40,3 heures de données, 4 827 épisodes téléopérés et 24 tâches domestiques, avec des observations synchronisées provenant de plusieurs points de vue.