Xiaomi lanzó el 15 de julio de 2026 Xiaomi Robotics U0, un modelo abierto de 38.000 millones de parámetros orientado a generar y modificar datos visuales sintéticos para entrenar robots; no es una política de control... El proyecto incluye pesos, herramientas de inferencia, demos de Gradio y rutas AR/FlashAR bajo li...
Publicado porEditado con GPT-5.6 TerraImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on September 16, 2026, by open-sourcing Xiaomi-Robotics-U0, and how do its model sizes, public weights and tooling,. Article summary: The date appears to be wrong: the available evidence places Xiaomi’s open-source release in July 2026 (reported as July 15), not September 16. Xiaomi announced Xiaomi‑Robotics‑U0 as an open embodied “world foundation mod. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
La fecha de la consulta mezcla dos anuncios. El lanzamiento completo de Xiaomi-Robotics-U0 se reportó el 15 de julio de 2026; en septiembre, el repositorio comunicó nuevos pesos de 4.000 millones de parámetros, modelos para secuencias y código de entrenamiento con FSDP. 7
9
Xiaomi-Robotics-U0 es, sobre todo, una herramienta abierta para producir datos sintéticos controlables destinados al entrenamiento de robots. Puede generar o modificar escenarios visuales centrados en un robot, intentando conservar aspectos relevantes para el aprendizaje: la observación del robot, el contexto de manipulación, el punto de vista de la cámara y la coherencia de la escena. No es una política que convierta observaciones directamente en acciones del robot. 1
6
La versión principal de U0 se describe como un modelo fundacional multimodal y autorregresivo de mundo, de 38.000 millones de parámetros. La publicación abierta incluye pesos, código fuente y de inferencia, configuraciones componibles, puntos de entrada de Gradio y parches para inferencia autorregresiva y FlashAR/vLLM. El repositorio utiliza licencia Apache-2.0. 2
4
9
Posteriormente, Xiaomi incluyó tres versiones adicionales: Xiaomi-Robotics-U0-4B, Xiaomi-Robotics-U0-Sequence y Xiaomi-Robotics-U0-4B-Sequence, además del código de entrenamiento FSDP. En la práctica, U0 ya designa una familia en evolución, no solo el punto de control original de mayor tamaño. 9
La propuesta central de U0 es agrupar capacidades en una sola arquitectura. Xiaomi afirma que puede abordar:
Su aplicación más distintiva es el aumento de datos. A partir de una trayectoria o una observación real del robot, sería posible variar elementos como el fondo, la iluminación, los materiales o los objetos y crear nuevos ejemplos de entrenamiento sin repetir cada sesión de recogida de datos en el mundo físico. 3
7
Ahí está la diferencia frente a un generador de imágenes convencional, diseñado para crear una imagen atractiva por sí misma. El valor buscado por U0 es introducir variación controlada sin perder la geometría y el contexto de interacción que importan a un robot. 3
7
U0 es un modelo visual autorregresivo: genera tokens visuales de forma secuencial, en lugar de emplear el proceso iterativo de eliminación de ruido característico de muchos sistemas de difusión. Los informes describen una base que combina EMU3.5 con Qwen-3-32B y utiliza un tokenizador visual discreto compartido entre las tareas compatibles. 4
7
Este enfoque permite tratar imágenes, observaciones y secuencias temporales como flujos de tokens. Pero generar imágenes de alta resolución de este modo exige mucho cómputo, porque los tokens se producen en secuencia. Por ello Xiaomi acompaña el modelo con una ruta de inferencia especializada. 1
5
FlashAR+ es el método de Xiaomi para acelerar la decodificación de tokens visuales. En vez de producir todos los tokens estrictamente uno por uno, emplea generación paralela en antidiagonales. Encima de ello, vLLM gestiona los prefijos condicionales, el procesamiento por lotes y la caché KV paginada, manteniendo la regla de decodificación de FlashAR+. 1
9
Xiaomi comunicó que FlashAR con vLLM generó una imagen en 5,44 segundos con una GPU H20, resultado que calificó como 82,86 veces más rápido que su implementación AR eager original y 3,04 veces más rápido que FlashAR eager. 7
La comparación tiene un matiz importante: es frente a la línea base autorregresiva propia de Xiaomi y bajo la configuración que reportó. No demuestra que U0 sea 83 veces más rápido que los generadores de imágenes por difusión, todas las alternativas para generar datos robóticos o los sistemas de vídeo más avanzados. El hardware, la resolución, el lote de trabajo, la ruta del modelo y los ajustes de generación cambian el rendimiento real. 1
7
El repositorio admite ejecución eager y backends vLLM para inferencia AR y FlashAR. Eso no implica que todas las funciones tengan soporte idéntico ni el mismo rendimiento en cada motor. Los equipos que trabajen con secuencias temporales o flujos multimodales especializados deberían validar el punto de control y la ruta de inferencia concretos antes de adoptarlos. 9
| Tipo de sistema | Función principal | Dónde encaja U0 |
|---|---|---|
| Políticas robóticas | Transformar observaciones en acciones del robot | U0 trabaja antes: genera y aumenta datos. No sustituye a una política; su valor reportado está en mejorar el entrenamiento de políticas ante cambios de distribución. |
| Modelos de mundo o de datos centrados en robots | Crear escenas, observaciones, trayectorias o datos similares a los de un simulador | Su diferenciador declarado es reunir síntesis de escenas, transferencia, edición y despliegue orientado a vídeo en un solo modelo. |
| Generadores generales de imágenes | Crear y editar imágenes a partir de texto o imágenes | U0 también admite texto a imagen e imagen a imagen, pero Xiaomi enfatiza la consistencia corporizada, no una superioridad general de calidad visual. |
| Generadores generales de vídeo | Crear vídeo amplio o cinematográfico | La capacidad de vídeo de U0 está orientada a robots y no prueba que supere a los grandes modelos de vídeo generalista en calidad abierta. |
Xiaomi informa que U0 ocupó el primer puesto en WorldArena, con 126 modelos participantes en la evaluación reportada, y destaca seguimiento de instrucciones, calidad de interacción y consistencia multivista. La página oficial del proyecto también señala un primer puesto entre más de 100 modelos. 7
10
En robótica aplicada, Xiaomi afirma que al añadir datos sintéticos generados por U0 elevó el éxito fuera de distribución (out-of-distribution, OOD) en robots reales del 36,9% al 63,2% ante cambios como iluminación o fondos desconocidos. 6
7
Estos datos respaldan principalmente el uso de U0 como sistema de aumento de datos sintéticos. Sin embargo, siguen siendo resultados comunicados por el proyecto. Un puesto en WorldArena no acredita superioridad en todos los robots, políticas, tareas, simuladores ni pruebas de imagen o vídeo. Para reproducirlos de forma independiente harían falta la versión exacta del modelo, los prompts, la configuración de muestreo, el protocolo de evaluación, el sistema de puntuación y las versiones de los rivales. 7
10
La licencia Apache-2.0 del repositorio, los pesos y las herramientas de inferencia hace que U0 sea relativamente accesible para desarrolladores que dispongan de capacidad de cómputo suficiente. Aun así, conviene revisar la licencia y la documentación de cada punto de control, así como la procedencia y los usos permitidos de los datos de origen y de los datos sintéticos generados. 4
9
La generación de vídeo forma parte del conjunto de capacidades anunciado. No obstante, el material disponible no demuestra que, en el lanzamiento inicial de julio, los puntos de control de vídeo, las rutas de aceleración, los datos de entrenamiento y los procedimientos de evaluación estuvieran igual de completos y fueran igual de reproducibles para todas las funciones. Las rutas de imagen y transferencia son el foco de despliegue mejor documentado; antes de basar un producto en vídeo, conviene verificar ese flujo específico. 4
6
Xiaomi-Robotics-U0 destaca menos por reemplazar el control robótico o los modelos generalistas de medios y más por abrir una gran canalización autorregresiva unificada para generar datos visuales sintéticos controlables y relevantes para robots. El modelo principal de 38.000 millones de parámetros, las versiones posteriores más pequeñas, las herramientas públicas y la ruta FlashAR+/vLLM ofrecen un punto de partida práctico para investigación y aumento de datos en robótica. 7
9
Sus afirmaciones más relevantes —la comparación interna de velocidad de 82,86 veces, el liderazgo en WorldArena y el salto de éxito OOD del 36,9% al 63,2%— son prometedoras, pero deben comprobarse con el robot, la carga de trabajo, el hardware y el protocolo de evaluación de cada equipo antes de generalizarlas. 7
10
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Xiaomi lanzó el 15 de julio de 2026 Xiaomi Robotics U0, un modelo abierto de 38.000 millones de parámetros orientado a generar y modificar datos visuales sintéticos para entrenar robots; no es una política de control...
Xiaomi lanzó el 15 de julio de 2026 Xiaomi Robotics U0, un modelo abierto de 38.000 millones de parámetros orientado a generar y modificar datos visuales sintéticos para entrenar robots; no es una política de control... El proyecto incluye pesos, herramientas de inferencia, demos de Gradio y rutas AR/FlashAR bajo licencia Apache 2.0.
El liderazgo comunicado en WorldArena y la subida del éxito OOD en robots reales, del 36,9% al 63,2%, son resultados reportados por el proyecto y no una demostración independiente de superioridad general.