Lancé le 15 juillet 2026, Xiaomi Robotics U0 est un modèle de monde incarné ouvert de 38 milliards de paramètres destiné à générer et modifier des données synthétiques pour l’entraînement des robots, et non une politi... Les poids, outils d’inférence, interfaces Gradio et moteurs AR/FlashAR sont disponibles sous lic...
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on September 16, 2026, by open-sourcing Xiaomi-Robotics-U0, and how do its model sizes, public weights and tooling,. Article summary: The date appears to be wrong: the available evidence places Xiaomi’s open-source release in July 2026 (reported as July 15), not September 16. Xiaomi announced Xiaomi‑Robotics‑U0 as an open embodied “world foundation mod. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
La date évoquée dans la question mélange vraisemblablement deux annonces. La sortie complète de Xiaomi-Robotics-U0 a été signalée le 15 juillet 2026. En septembre, le dépôt du projet a annoncé des poids supplémentaires de 4 milliards de paramètres et des modèles de séquence, ainsi que le code d’entraînement FSDP. 7
9
Xiaomi-Robotics-U0 est avant tout un système génératif ouvert conçu pour produire des données synthétiques contrôlables pour la robotique. Il peut générer ou modifier des scènes visuelles centrées sur un robot tout en cherchant à préserver les éléments utiles à l’entraînement : observations du robot, contexte de manipulation, point de vue de la caméra et cohérence de la scène. Ce n’est pas, en lui-même, un modèle qui transforme une observation en action de robot. 1
6
Le modèle U0 principal est présenté comme un modèle de monde multimodal autorégressif de 38 milliards de paramètres. La publication ouverte comprend les poids, le code source et d’inférence, des configurations composables, des points d’entrée Gradio, ainsi que des correctifs pour l’inférence autorégressive et FlashAR/vLLM. Le dépôt est distribué sous licence Apache-2.0. 2
4
9
Xiaomi a ensuite listé trois sorties supplémentaires en septembre : Xiaomi-Robotics-U0-4B, Xiaomi-Robotics-U0-Sequence et Xiaomi-Robotics-U0-4B-Sequence, accompagnées du code d’entraînement FSDP. « U0 » désigne donc désormais une famille de modèles en évolution, et non plus seulement le point de contrôle initial à grande échelle. 9
L’ambition centrale de U0 est de réunir plusieurs fonctions dans une seule architecture. Xiaomi indique qu’elle prend en charge :
Son cas d’usage le plus distinctif est l’augmentation de données. À partir d’une trajectoire ou d’une observation réelle, une équipe peut faire varier l’arrière-plan, l’éclairage, les matériaux ou les objets, afin de créer de nouveaux exemples d’entraînement sans devoir répéter chaque collecte physique. 3
7
C’est ce qui distingue U0 d’un générateur d’images classique, optimisé avant tout pour produire une image convaincante prise isolément. Ici, la valeur recherchée est une variation contrôlée qui conserve la géométrie et le contexte d’interaction pertinents pour le robot. 3
7
U0 est un modèle visuel autorégressif. Au lieu de s’appuyer sur le débruitage itératif associé aux systèmes de diffusion, il génère séquentiellement des jetons visuels discrets. Les descriptions disponibles indiquent qu’il combine EMU3.5 et Qwen-3-32B, avec un tokenizer visuel discret partagé entre les tâches prises en charge. 4
7
Cette approche permet de traiter images, observations et séquences temporelles comme des flux de jetons. En revanche, produire en séquence un grand nombre de jetons rend la génération haute résolution coûteuse en calcul. C’est pourquoi Xiaomi l’associe à une voie d’inférence spécialisée. 1
5
FlashAR+ est la méthode d’accélération de Xiaomi pour le décodage des jetons visuels. Elle recourt à une génération parallèle par anti-diagonales, plutôt que de produire strictement chaque jeton l’un après l’autre. vLLM s’ajoute à cette méthode pour gérer les préfixes conditionnels, le traitement par lots et le cache KV paginé, tout en conservant la règle de décodage de FlashAR+. 1
9
Xiaomi indique que FlashAR avec vLLM a généré une image en 5,44 secondes sur un GPU H20, soit 82,86 fois plus vite que son implémentation AR « eager » d’origine, et 3,04 fois plus vite que FlashAR en mode eager. 7
La précision est essentielle : la comparaison porte sur la référence autorégressive interne de Xiaomi, dans sa propre configuration de test. Elle ne prouve pas que U0 est 83 fois plus rapide que les générateurs d’images par diffusion, que tous les pipelines de données robotiques concurrents ou que les meilleurs systèmes vidéo. Le matériel, les paramètres d’image, le traitement par lots, le chemin de modèle et la charge de travail changent fortement le débit réel. 1
7
Le dépôt prend en charge les moteurs eager et vLLM pour l’inférence AR comme FlashAR. Cela ne signifie toutefois pas que chaque capacité bénéficie d’un support ou de performances identiques dans tous les moteurs. Les équipes qui visent des flux temporels ou multimodaux spécialisés ont intérêt à tester le point de contrôle et le chemin d’inférence exacts retenus. 9
| Type de système | Usage principal | Positionnement de U0 |
|---|---|---|
| Politiques robotiques | Convertir les observations en actions du robot | U0 intervient en amont, pour générer et augmenter les données ; il ne remplace pas une politique. Son bénéfice aval revendiqué concerne l’amélioration de l’entraînement des politiques face aux changements de distribution. |
| Modèles de monde ou de données centrés sur le robot | Produire des scènes, observations, trajectoires ou données proches de la simulation | Le différenciateur revendiqué par U0 est de regrouper synthèse de scènes, transfert, édition d’images et déroulement vidéo dans un seul modèle. |
| Générateurs d’images généralistes | Création et édition visuelles pour de nombreux usages | U0 prend en charge le texte-vers-image et l’image-vers-image, mais Xiaomi met surtout en avant la cohérence incarnée, sans revendiquer de façon générale la meilleure qualité d’image. |
| Générateurs vidéo généralistes | Création de vidéos larges ou cinématographiques | La fonction vidéo de U0 est orientée robotique. Elle ne démontre pas, à elle seule, une supériorité sur les grands modèles vidéo généralistes pour la qualité vidéo ouverte. |
Xiaomi affirme que U0 s’est classé premier sur WorldArena, parmi 126 modèles participants dans l’évaluation rapportée, et met en avant le suivi des instructions, la qualité des interactions et la cohérence multi-vues. La page officielle du projet évoque également une première place parmi plus de 100 modèles. 7
10
Pour les usages robotiques en aval, Xiaomi rapporte que l’ajout de données synthétiques générées par U0 a fait passer le taux de réussite hors distribution sur robot réel de 36,9 % à 63,2 %, face à des variations telles qu’un éclairage ou des arrière-plans inconnus. 6
7
Ces résultats soutiennent surtout l’intérêt de U0 comme outil d’augmentation de données synthétiques. Ils restent cependant rapportés par le projet lui-même. Une première place sur WorldArena ne suffit pas à établir une supériorité sur chaque robot, politique, tâche, simulateur ou benchmark généraliste d’images et de vidéos. Une reproduction indépendante demanderait notamment la version précise du modèle, les invites, la configuration d’échantillonnage, le protocole d’évaluation, le dispositif de notation et les versions des modèles comparés. 7
10
La licence Apache-2.0 appliquée au dépôt, aux poids et aux outils d’inférence rend U0 relativement accessible aux développeurs disposant de ressources de calcul suffisantes. Il convient néanmoins de consulter la licence et la documentation de chaque point de contrôle, ainsi que de vérifier la provenance et les conditions d’utilisation des données sources comme des données d’entraînement générées. 4
9
La génération vidéo fait bien partie de l’ensemble de capacités annoncé. Mais les éléments de publication fournis n’établissent pas que les points de contrôle vidéo, les voies d’accélération, les données d’entraînement et les procédures d’évaluation étaient aussi complets et reproductibles pour toutes les fonctions lors du lancement initial de juillet. Les flux image et transfert sont les usages les mieux documentés ; pour la vidéo, il faut valider précisément le flux visé avant de bâtir un projet autour de cette fonction. 4
6
Xiaomi-Robotics-U0 est important moins parce qu’il remplacerait le contrôle robotique ou les modèles généralistes de médias, que parce qu’il ouvre un pipeline autorégressif de grande taille pour générer des données visuelles synthétiques, contrôlables et pertinentes pour les robots. Le modèle phare de 38 milliards de paramètres, les poids plus légers publiés ensuite, l’outillage public et le chemin FlashAR+/vLLM offrent une base concrète aux chercheurs et aux équipes de robotique qui travaillent sur l’augmentation de données. 7
9
Ses affirmations les plus marquantes — une accélération interne de 82,86×, une première place sur WorldArena et une hausse de 36,9 % à 63,2 % du taux de réussite hors distribution — sont prometteuses. Elles doivent toutefois être vérifiées sur le robot, la charge de travail, le matériel et le protocole d’évaluation ciblés avant toute généralisation. 7
10
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Lancé le 15 juillet 2026, Xiaomi Robotics U0 est un modèle de monde incarné ouvert de 38 milliards de paramètres destiné à générer et modifier des données synthétiques pour l’entraînement des robots, et non une politi...
Lancé le 15 juillet 2026, Xiaomi Robotics U0 est un modèle de monde incarné ouvert de 38 milliards de paramètres destiné à générer et modifier des données synthétiques pour l’entraînement des robots, et non une politi... Les poids, outils d’inférence, interfaces Gradio et moteurs AR/FlashAR sont disponibles sous licence Apache 2.0.
La première place revendiquée sur WorldArena et le passage de 36,9 % à 63,2 % de réussite hors distribution sur robot réel sont des résultats rapportés par le projet, pas une validation indépendante d’une supériorité...