Pełna premiera Xiaomi Robotics U0 nastąpiła 15 lipca 2026 r. Model 38B tworzy i modyfikuje syntetyczne dane wizualne dla robotów; nie jest polityką sterowania robotem.
Opublikowane przezEdytowane za pomocą GPT-5.6 TerraObrazy wygenerowane za pomocą GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on September 16, 2026, by open-sourcing Xiaomi-Robotics-U0, and how do its model sizes, public weights and tooling,. Article summary: The date appears to be wrong: the available evidence places Xiaomi’s open-source release in July 2026 (reported as July 15), not September 16. Xiaomi announced Xiaomi‑Robotics‑U0 as an open embodied “world foundation mod. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
Pytanie miesza dwie daty. Pełne wydanie Xiaomi-Robotics-U0 opisywano jako premierę z 15 lipca 2026 r. We wrześniu repozytorium projektu podało natomiast informację o dodatkowych wagach 4B i modelach sekwencyjnych oraz o udostępnieniu kodu treningowego FSDP. 7
9
Xiaomi-Robotics-U0 należy rozumieć przede wszystkim jako otwarty system do wytwarzania kontrolowanych, syntetycznych danych dla robotyki. Model może generować albo przekształcać sceny widziane z perspektywy robota, starając się zachować elementy istotne podczas treningu: obserwacje robota, kontekst manipulacji, punkt widzenia kamery i spójność sceny. Nie jest jednak sam w sobie polityką działania robota, czyli systemem zamieniającym obserwacje bezpośrednio w komendy ruchu. 1
6
Flagowy U0 opisano jako multimodalny, autoregresyjny model świata o 38 mld parametrów. Otwarte wydanie obejmuje wagi modelu, kod źródłowy i kod inferencji, konfigurowalne ustawienia, punkty wejścia Gradio oraz poprawki dla inferencji autoregresyjnej i FlashAR/vLLM. Repozytorium działa na licencji Apache-2.0. 2
4
9
We wrześniu Xiaomi wymieniło trzy kolejne wydania: Xiaomi-Robotics-U0-4B, Xiaomi-Robotics-U0-Sequence i Xiaomi-Robotics-U0-4B-Sequence, a także kod treningowy FSDP. W praktyce U0 jest więc rozwijaną rodziną modeli, a nie wyłącznie pierwotnym, dużym checkpointem. 9
Główna obietnica U0 to konsolidacja funkcji. Według Xiaomi jedna architektura obsługuje:
Najbardziej charakterystyczne zastosowanie to augmentacja danych. Punkt wyjścia może stanowić trajektoria lub obserwacja robota; model pozwala zmieniać m.in. tło, oświetlenie, materiały albo obiekty, aby uzyskiwać nowe przykłady treningowe bez powtarzania każdego zbioru danych w świecie fizycznym. 3
7
To odróżnia U0 od typowego generatora obrazów, który ma przede wszystkim stworzyć atrakcyjną pojedynczą grafikę. Tu zamierzona wartość polega na kontrolowanej zmienności przy zachowaniu geometrii i kontekstu interakcji ważnych dla robota. 3
7
U0 jest wizualnym modelem autoregresyjnym. Zamiast stosować iteracyjne odszumianie znane z dyfuzyjnych generatorów obrazu, tworzy kolejno dyskretne tokeny wizualne. W opisach wskazano, że bazę stanowi połączenie EMU3.5 i Qwen-3-32B, a między obsługiwanymi zadaniami współdzielony jest dyskretny tokenizer wizualny. 4
7
Takie podejście ułatwia traktowanie obrazów, obserwacji i sekwencji czasowych jako strumieni tokenów. Ma jednak koszt: generowanie w wysokiej rozdzielczości jest obliczeniowo wymagające, gdy tokeny trzeba produkować sekwencyjnie. Właśnie dlatego Xiaomi połączyło model ze specjalizowaną ścieżką przyspieszania inferencji. 1
5
FlashAR+ to metoda Xiaomi przyspieszająca dekodowanie tokenów wizualnych. Zamiast generować każdy token ściśle po kolei, wykorzystuje równoległe generowanie po antyprzekątnych. Z kolei vLLM obsługuje warunkowe prefiksy, przetwarzanie wsadowe i stronicowany cache KV, zachowując regułę dekodowania FlashAR+. 1
9
Xiaomi podało, że FlashAR z vLLM wygenerował obraz w 5,44 sekundy na jednym GPU H20. Firma określiła to jako wynik 82,86 raza szybszy od własnej pierwotnej implementacji AR eager oraz 3,04 raza szybszy od FlashAR eager. 7
To ważne zastrzeżenie: porównanie dotyczy własnej, autoregresyjnej konfiguracji bazowej Xiaomi w raportowanym środowisku. Nie dowodzi, że U0 jest 83 razy szybszy od dyfuzyjnych generatorów obrazów, wszystkich konkurencyjnych potoków danych robotycznych ani czołowych systemów wideo. Rzeczywistą przepustowość zmieniają m.in. sprzęt, ustawienia obrazu, batchowanie, wybrana ścieżka modelu i rodzaj obciążenia. 1
7
Repozytorium obsługuje backendy eager i vLLM zarówno dla inferencji AR, jak i FlashAR. Nie oznacza to jednak, że każda funkcja ma identyczne wsparcie lub wydajność w każdym silniku. Zespoły pracujące nad sekwencjami czasowymi albo wyspecjalizowanymi przepływami multimodalnymi powinny sprawdzić konkretny checkpoint i wybraną ścieżkę inferencji. 9
| Typ systemu | Główny cel | Gdzie plasuje się U0 |
|---|---|---|
| Polityki robotyczne | Zamiana obserwacji na działania robota | U0 działa wcześniej w łańcuchu: generuje i rozszerza dane, a nie zastępuje polityki. Jego deklarowana wartość w dalszym etapie to lepszy trening polityki przy zmianach rozkładu danych. |
| Modele świata lub danych skupione na robotach | Tworzenie scen, obserwacji, trajektorii albo danych przypominających symulację | Deklarowanym wyróżnikiem U0 jest jeden model obejmujący syntezę scen, transfer, edycję obrazu i zorientowane na roboty rozwijanie sekwencji wideo. |
| Ogólne generatory obrazów | Szeroka generacja i edycja z tekstu lub obrazu | U0 obsługuje tekst–obraz i obraz–obraz, ale Xiaomi akcentuje spójność ucieleśnioną, nie formułuje zaś szerokiej, niezależnie potwierdzonej tezy o przewadze w ogólnej jakości obrazów. |
| Ogólne generatory wideo | Filmowe i szerokie zastosowania wideo | Funkcja wideo w U0 ma charakter robotyczny. Nie należy jej traktować jako dowodu przewagi nad najlepszymi ogólnymi generatorami wideo w otwartej ocenie jakości. |
Xiaomi podaje, że U0 zajęło pierwsze miejsce w WorldArena, przy 126 modelach uczestniczących w raportowanej ocenie. Firma podkreśla m.in. wykonywanie instrukcji, jakość interakcji i spójność między różnymi ujęciami. Oficjalna strona projektu mówi też o pierwszym miejscu wśród ponad 100 modeli. 7
10
W zastosowaniach robotycznych Xiaomi informuje, że dodanie danych syntetycznych wygenerowanych przez U0 podniosło skuteczność polityki na prawdziwym robocie poza rozkładem treningowym (OOD) z 36,9% do 63,2% — w warunkach takich jak nieznane oświetlenie i tła. 6
7
To najmocniejszy argument za wykorzystaniem U0 do augmentacji danych syntetycznych. Są to jednak wyniki raportowane przez twórców projektu. Sam wynik WorldArena nie ustanawia przewagi w każdym robocie, dla każdej polityki, zadania, symulatora ani ogólnego benchmarku obrazu czy wideo. Niezależne odtworzenie wymagałoby dokładnej wersji modelu, promptów, konfiguracji próbkowania, protokołu oceny, sposobu punktacji i wersji porównywanych modeli. 7
10
Licencja Apache-2.0 dla repozytorium, wag i narzędzi inferencyjnych czyni U0 relatywnie dostępnym dla programistów dysponujących odpowiednią mocą obliczeniową. Przed wdrożeniem należy jednak sprawdzić licencję oraz dokumentację każdego checkpointu, a także pochodzenie i dopuszczalne wykorzystanie danych źródłowych oraz wygenerowanych danych treningowych. 4
9
Generowanie wideo jest wymieniane jako element wspólnego zestawu możliwości. Dostępne materiały nie dowodzą jednak, że checkpointy wideo, ścieżki przyspieszania, dane treningowe i procedury ewaluacji były przy pierwszej lipcowej premierze równie kompletne i odtwarzalne dla wszystkich funkcji. Najlepiej udokumentowane pod kątem wdrożenia są przepływy obrazowe i transferowe; konkretny proces wideo warto zweryfikować przed oparciem na nim projektu. 4
6
Znaczenie Xiaomi-Robotics-U0 nie polega na zastąpieniu sterowania robotem ani modeli do mediów ogólnego przeznaczenia. Istotne jest raczej otwarcie dużego, spójnego potoku autoregresyjnego do generowania kontrolowanych danych wizualnych istotnych dla robotyki. Flagowy model 38B, późniejsze mniejsze wagi, publiczne narzędzia oraz ścieżka FlashAR+/vLLM dają badaczom i zespołom robotycznym praktyczny punkt wyjścia do augmentacji danych. 7
9
Najważniejsze deklaracje — 82,86-krotne przyspieszenie w wewnętrznym porównaniu, prowadzenie w WorldArena i wzrost skuteczności OOD z 36,9% do 63,2% — wyglądają obiecująco. Przed uogólnieniem tych wniosków należy jednak sprawdzić je na docelowym robocie, obciążeniu, sprzęcie i protokole oceny. 7
10
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pełna premiera Xiaomi Robotics U0 nastąpiła 15 lipca 2026 r. Model 38B tworzy i modyfikuje syntetyczne dane wizualne dla robotów; nie jest polityką sterowania robotem.
Pełna premiera Xiaomi Robotics U0 nastąpiła 15 lipca 2026 r. Model 38B tworzy i modyfikuje syntetyczne dane wizualne dla robotów; nie jest polityką sterowania robotem. Udostępniono wagi, kod inferencji, konfiguracje, interfejs Gradio oraz ścieżki AR i FlashAR.
Pierwsze miejsce w WorldArena oraz wzrost skuteczności OOD z 36,9% do 63,2% to obiecujące wyniki raportowane przez projekt, a nie niezależnie potwierdzony dowód przewagi we wszystkich zastosowaniach.