Xiaomi veröffentlichte Xiaomi Robotics U0 am 15. Juli 2026 als offenes multimodales Weltmodell mit 38 Milliarden Parametern für die Erzeugung und Bearbeitung synthetischer Robotertrainingsdaten – nicht als Steuerungsm...
Veröffentlicht vonBearbeitet mit GPT-5.6 TerraBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on September 16, 2026, by open-sourcing Xiaomi-Robotics-U0, and how do its model sizes, public weights and tooling,. Article summary: The date appears to be wrong: the available evidence places Xiaomi’s open-source release in July 2026 (reported as July 15), not September 16. Xiaomi announced Xiaomi‑Robotics‑U0 as an open embodied “world foundation mod. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
Die Datumsangabe in der ursprünglichen Frage vermischt offenbar zwei Aktualisierungen: Der umfassende Release von Xiaomi-Robotics-U0 wurde für den 15. Juli 2026 gemeldet. Im September kündigte das Projekt-Repository zusätzlich 4B- und Sequenz-Modellgewichte sowie FSDP-Trainingscode an. 7
9
Xiaomi-Robotics-U0 ist vor allem als offenes System zur Herstellung kontrollierbarer synthetischer Trainingsdaten für die Robotik einzuordnen. Es kann visuelle Szenarien aus der Perspektive eines Roboters generieren oder verändern und soll dabei für das Training entscheidende Elemente erhalten – etwa Roboterbeobachtungen, Manipulationskontext, Kameraperspektive und Konsistenz der Szene. Es ist keine Aktions- oder Steuerungspolitik für einen Roboter. 1
6
Das Flaggschiff U0 wird als multimodales, autoregressives Welt-Grundlagenmodell mit 38 Milliarden Parametern beschrieben. Der offene Release umfasst Modellgewichte, Quell- und Inferenzcode, kombinierbare Konfigurationen, Gradio-Einstiegspunkte sowie Patches für autoregressive Inferenz und FlashAR/vLLM. Das Repository steht unter der Lizenz Apache-2.0. 2
4
9
Im September führte Xiaomi drei weitere Veröffentlichungen auf: Xiaomi-Robotics-U0-4B, Xiaomi-Robotics-U0-Sequence und Xiaomi-Robotics-U0-4B-Sequence. Zusammen mit dem FSDP-Trainingscode zeigt das: „U0“ bezeichnet inzwischen eine wachsende Modellfamilie und nicht nur den ursprünglichen großen Checkpoint. 9
Der zentrale Anspruch von U0 ist die Bündelung mehrerer Funktionen in einer Architektur. Xiaomi nennt unter anderem:
Besonders interessant ist die Datenerweiterung: Ausgehend von einer Robotertrajektorie oder Beobachtung lassen sich Faktoren wie Hintergrund, Licht, Materialien oder Objekte variieren. So können zusätzliche Trainingsbeispiele entstehen, ohne jeden Datensatz erneut in einer realen Umgebung aufzeichnen zu müssen. 3
7
Genau darin unterscheidet sich U0 von einem klassischen Bildgenerator, der vor allem ein überzeugendes Einzelbild liefern soll. Der Nutzen liegt hier in kontrollierten Variationen, bei denen roboterrelevante Geometrie und Interaktionskontext möglichst erhalten bleiben. 3
7
U0 ist ein autoregressives visuelles Modell. Es erzeugt diskrete visuelle Token nacheinander, statt auf den iterativen Entrauschungsprozess zu setzen, der für viele diffusionbasierte Bildsysteme typisch ist. Berichten zufolge kombiniert die Basis EMU3.5 mit Qwen-3-32B; für die unterstützten Aufgaben kommt ein gemeinsamer diskreter visueller Tokenizer zum Einsatz. 4
7
Der Ansatz eignet sich grundsätzlich gut dafür, Bilder, Beobachtungen und zeitliche Sequenzen als Tokenströme zu behandeln. Zugleich ist die Erzeugung hochauflösender Inhalte rechenintensiv, wenn viele Token in Folge produziert werden müssen. Deshalb kombiniert Xiaomi das Modell mit einem spezialisierten Inferenzpfad. 1
5
FlashAR+ ist Xiaomis Beschleunigungsmethode für das Dekodieren visueller Token. Statt jeden Token strikt einzeln zu erzeugen, setzt sie auf parallele anti-diagonale Generierung. vLLM übernimmt darüber hinaus die Verarbeitung bedingter Präfixe, Batching und das paginierte KV-Cache-Management; die FlashAR+-Dekodierregel bleibt dabei erhalten. 1
9
Xiaomi gab an, mit FlashAR und vLLM auf einer einzelnen H20-GPU ein Bild in 5,44 Sekunden zu generieren. Das sei 82,86-mal schneller als die eigene ursprüngliche autoregressive Eager-Implementierung und 3,04-mal schneller als FlashAR im Eager-Modus. 7
Diese Einordnung ist entscheidend: Der Wert vergleicht Xiaomis Lösung mit der eigenen autoregressiven Eager-Basis unter dem gemeldeten Versuchsaufbau. Daraus folgt nicht, dass U0 83-mal schneller wäre als diffusionbasierte Bildgeneratoren, andere Pipelines für Roboterdaten oder führende Videosysteme. Hardware, Bildparameter, Batching, Modellpfad und Arbeitslast beeinflussen den tatsächlichen Durchsatz. 1
7
Das Repository unterstützt für AR- und FlashAR-Inferenz sowohl Eager-Ausführung als auch vLLM-Backends. Daraus lässt sich jedoch nicht ableiten, dass jede Funktion über jeden Inferenzweg identisch unterstützt wird oder gleich schnell läuft. Teams mit zeitlichen Sequenzen oder spezialisierten multimodalen Abläufen sollten deshalb den konkret vorgesehenen Checkpoint und Inferenzpfad prüfen. 9
| Systemtyp | Hauptzweck | Rolle von U0 |
|---|---|---|
| Roboter-Policies | Beobachtungen in Roboteraktionen umsetzen | U0 ist ein vorgelagertes Modell zur Datengenerierung und -erweiterung, kein Ersatz für eine Policy. Der berichtete nachgelagerte Nutzen betrifft robusteres Policy-Training bei Verteilungsverschiebungen. |
| Roboterzentrierte Welt- oder Datenmodelle | Roboterszenen, Beobachtungen, Trajektorien oder simulationsähnliche Daten erzeugen | U0s beanspruchtes Alleinstellungsmerkmal ist ein einzelnes Modell für Szenensynthese, Transfer, Bildbearbeitung und videoorientiertes Ausrollen. |
| Allgemeine Bildgeneratoren | Breite Text-/Bild-Erstellung und Bearbeitung | U0 beherrscht Text-zu-Bild und Bild-zu-Bild, doch Xiaomi betont verkörperte Konsistenz. Eine allgemein gültige Spitzenposition bei Bildqualität wird damit nicht belegt. |
| Allgemeine Videogeneratoren | Filmische und breit einsetzbare Videoerzeugung | Die Videofunktion von U0 ist roboterorientiert. Daraus lässt sich keine Überlegenheit gegenüber führenden allgemeinen Videomodellen bei offener Videoqualität ableiten. |
Xiaomi berichtet über Platz eins bei WorldArena, mit 126 teilnehmenden Modellen in der gemeldeten Auswertung, und hebt dabei Instruktionsbefolgung, Interaktionsqualität und Mehransichtskonsistenz hervor. Die offizielle Projektseite spricht ebenfalls von Rang eins unter mehr als 100 Modellen. 7
10
Für nachgelagerte Robotikaufgaben meldet Xiaomi, dass zusätzlich mit U0 erzeugte synthetische Daten die Out-of-Distribution-Erfolgsrate eines realen Roboters von 36,9 auf 63,2 Prozent steigerten – etwa bei ungewohnter Beleuchtung und veränderten Hintergründen. 6
7
Das spricht am stärksten für U0 als Werkzeug zur Ergänzung von Trainingsdaten. Es bleiben jedoch vom Projekt gemeldete Resultate. Ein WorldArena-Rang allein beweist keine Überlegenheit für jeden Roboter, jede Policy, Aufgabe, Simulation oder allgemeine Bild- und Video-Benchmark. Für eine unabhängige Reproduktion wären unter anderem exakte Modellversion, Prompts, Sampling-Konfiguration, Evaluierungsprotokoll, Scoring-Setup und Vergleichsversionen erforderlich. 7
10
Die Apache-2.0-Lizenz für Repository, Gewichte und Inferenzwerkzeuge macht U0 für Entwicklerinnen und Entwickler mit ausreichender Rechenleistung vergleichsweise zugänglich. Vor dem produktiven Einsatz sollten Teams dennoch die Lizenz- und Modelldokumentation jedes Checkpoints sowie Herkunft und zulässige Nutzung der Ausgangs- und generierten Trainingsdaten prüfen. 4
9
Videogenerierung gehört zum beschriebenen einheitlichen Funktionsumfang. Die vorliegenden Release-Unterlagen belegen aber nicht, dass Videocheckpoints, Beschleunigungspfade, Trainingsdaten und Evaluierungsverfahren beim Start im Juli für alle Funktionen gleichermaßen vollständig und reproduzierbar verfügbar waren. Die Bild- und Transfer-Workflows sind der klarer dokumentierte Einsatzschwerpunkt; ein konkreter Videoworkflow sollte vor einer Festlegung separat geprüft werden. 4
6
Xiaomi-Robotics-U0 ist vor allem deshalb bemerkenswert, weil es eine große, einheitliche autoregressive Pipeline für kontrollierbare, roboterrelevante synthetische visuelle Daten offen verfügbar macht – nicht weil es Robotersteuerungen oder universelle Medienmodelle ersetzt. Das 38B-Flaggschiff, kleinere nachgereichte Gewichte, öffentliche Werkzeuge und der FlashAR+/vLLM-Pfad bieten Forschungsteams und Robotikunternehmen einen praktischen Ausgangspunkt für Datenerweiterung. 7
9
Die wichtigsten Angaben – der interne Geschwindigkeitsvergleich von 82,86×, die WorldArena-Führung und der Sprung der OOD-Erfolgsrate von 36,9 auf 63,2 Prozent – sind vielversprechend. Sie sollten aber gegen den jeweiligen Roboter, die konkrete Arbeitslast, die Hardware und ein nachvollziehbares Evaluierungsprotokoll getestet werden, bevor daraus allgemeine Schlüsse gezogen werden. 7
10
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Xiaomi veröffentlichte Xiaomi Robotics U0 am 15. Juli 2026 als offenes multimodales Weltmodell mit 38 Milliarden Parametern für die Erzeugung und Bearbeitung synthetischer Robotertrainingsdaten – nicht als Steuerungsm...
Xiaomi veröffentlichte Xiaomi Robotics U0 am 15. Juli 2026 als offenes multimodales Weltmodell mit 38 Milliarden Parametern für die Erzeugung und Bearbeitung synthetischer Robotertrainingsdaten – nicht als Steuerungsm... Zum Apache 2.0 Release gehören Gewichte, Inferenzwerkzeuge, Gradio Einstiege sowie AR und FlashAR Backends.
Die gemeldete Spitzenplatzierung bei WorldArena und der Anstieg der OOD Erfolgsrate eines realen Roboters von 36,9 auf 63,2 Prozent sind vielversprechende Herstellerangaben, aber kein unabhängig geprüfter Beleg für ei...