Xiaomi ने 15 जुलाई 2026 को 38B पैरामीटर वाला Xiaomi Robotics U0 जारी किया। यह रोबोट कंट्रोल पॉलिसी नहीं, बल्कि रोबोट ट्रेनिंग के लिए सिंथेटिक विज़ुअल डेटा बनाने और संशोधित करने वाला embodied world model है। रिलीज़ में वेट्स, इन्फरेंस टूलिंग, Gradio एंट्री पॉइंट और Apache 2.0 के तहत AR/FlashAR बैकएंड शामिल हैं। सितंब...
प्रकाशितकर्ताGPT-5.6 Terra से संपादितGPT Image 2 से चित्र बनाए गए
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What did Xiaomi announce on September 16, 2026, by open-sourcing Xiaomi-Robotics-U0, and how do its model sizes, public weights and tooling,. Article summary: The date appears to be wrong: the available evidence places Xiaomi’s open-source release in July 2026 (reported as July 15), not September 16. Xiaomi announced Xiaomi‑Robotics‑U0 as an open embodied “world foundation mod. Topic tags: general, academic, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake num
मूल सवाल में तारीख दो अलग अपडेट्स को मिला देती है। Xiaomi-Robotics-U0 का मुख्य, पूर्ण-स्तरीय रिलीज़ 15 जुलाई 2026 को रिपोर्ट हुआ था। सितंबर में प्रोजेक्ट रिपॉजिटरी ने अतिरिक्त 4B और sequence-model वेट्स के साथ FSDP ट्रेनिंग कोड जारी करने की जानकारी दी। 7
9
Xiaomi-Robotics-U0 को समझने का सबसे सीधा तरीका यह है: यह रोबोटिक्स के लिए नियंत्रित सिंथेटिक ट्रेनिंग डेटा तैयार करने वाला ओपन जेनरेटिव सिस्टम है। यह रोबोट-केंद्रित विज़ुअल दृश्यों को बना या बदल सकता है और कोशिश करता है कि ट्रेनिंग के अहम तत्व—मसलन रोबोट के कैमरा ऑब्ज़र्वेशन, वस्तु पकड़ने-हिलाने का संदर्भ, कैमरे का दृष्टिकोण और दृश्य की निरंतरता—बने रहें। यह खुद रोबोट के लिए action policy नहीं है। 1
6
मुख्य U0 मॉडल को 38 अरब पैरामीटर वाला मल्टीमॉडल, ऑटोरेग्रेसिव वर्ल्ड फाउंडेशन मॉडल बताया गया है। ओपन रिलीज़ में मॉडल वेट्स, सोर्स व इन्फरेंस कोड, कॉम्पोज़ेबल कॉन्फ़िगरेशन, Gradio एंट्री पॉइंट तथा autoregressive और FlashAR/vLLM इन्फरेंस के पैच शामिल हैं। रिपॉजिटरी Apache-2.0 लाइसेंस के अंतर्गत है। 2
4
9
सितंबर में Xiaomi ने तीन और रिलीज़ सूचीबद्ध किए: Xiaomi-Robotics-U0-4B, Xiaomi-Robotics-U0-Sequence और Xiaomi-Robotics-U0-4B-Sequence। इनके साथ FSDP ट्रेनिंग कोड भी जारी किया गया। यानी अब “U0” केवल मूल बड़े checkpoint का नाम नहीं, बल्कि विकसित हो रहा मॉडल-परिवार है। 9
U0 का प्रमुख दावा कई अलग टूल्स को एक आर्किटेक्चर में समेटना है। Xiaomi के अनुसार, यह एक ही मॉडल इन कामों को संभालता है:
व्यावहारिक रूप से इसका सबसे अलग उपयोग डेटा ऑगमेंटेशन है। उदाहरण के लिए, किसी रोबोट की मौजूदा trajectory या कैमरा ऑब्ज़र्वेशन लेकर पृष्ठभूमि, रोशनी, सतह की सामग्री या आसपास की वस्तुओं को बदला जा सकता है। इस तरह हर नए वैरिएशन के लिए वास्तविक दुनिया में फिर से डेटा रिकॉर्ड करने की जरूरत घट सकती है। 3
7
यही इसे साधारण इमेज जनरेटर से अलग बनाता है, जिसका लक्ष्य अक्सर सिर्फ आकर्षक स्वतंत्र तस्वीर बनाना होता है। U0 का उद्देश्य रोबोट के लिए उपयोगी ज्यामिति और interaction context को बचाए रखते हुए नियंत्रित बदलाव करना है। 3
7
U0 एक ऑटोरेग्रेसिव विज़ुअल मॉडल है। diffusion आधारित इमेज सिस्टम की तरह बार-बार denoising करने के बजाय यह discrete visual tokens को क्रम से बनाता है। रिपोर्ट्स में इसके आधार को EMU3.5 और Qwen-3-32B के संयोजन के रूप में बताया गया है; समर्थित कार्यों के बीच एक साझा discrete visual tokenizer इस्तेमाल होता है। 4
7
इस तरीके में इमेज, रोबोट ऑब्ज़र्वेशन और समय-क्रम वाले sequences को token stream की तरह देखना सहज हो सकता है। लेकिन हाई-रिज़ॉल्यूशन आउटपुट महंगा पड़ता है, क्योंकि बहुत से tokens को क्रमशः जनरेट करना होता है। इसी लागत को घटाने के लिए Xiaomi ने विशेष इन्फरेंस पाथ जोड़ा है। 1
5
FlashAR+ Xiaomi की visual-token decoding तेज करने की विधि है। हर token को सख्ती से एक-एक कर निकालने के बजाय यह parallel anti-diagonal generation का उपयोग करती है। इसके ऊपर vLLM को conditional prefixes, batching और paged KV-cache execution संभालने के लिए जोड़ा गया है, जबकि FlashAR+ का decoding नियम कायम रहता है। 1
9
Xiaomi ने बताया कि FlashAR के साथ vLLM ने एक H20 GPU पर एक इमेज 5.44 सेकंड में बनाई—जो उसके मूल AR eager implementation से 82.86 गुना तेज और FlashAR eager से 3.04 गुना तेज था। 7
यहां तुलना की सीमा महत्वपूर्ण है। यह Xiaomi के अपने ऑटोरेग्रेसिव eager baseline के विरुद्ध, उसके बताए गए सेटअप में किया गया दावा है। इससे यह निष्कर्ष नहीं निकलता कि U0 हर diffusion इमेज जनरेटर, हर रोबोटिक्स डेटा पाइपलाइन या सभी उन्नत वीडियो सिस्टम से 83 गुना तेज है। वास्तविक थ्रूपुट पर हार्डवेयर, इमेज सेटिंग्स, batching, मॉडल पाथ और workload का असर पड़ता है। 1
7
रिपॉजिटरी AR और FlashAR, दोनों के लिए eager तथा vLLM बैकएंड सपोर्ट करती है। फिर भी यह मानना सही नहीं होगा कि हर क्षमता को हर इंजन में एक-सा समर्थन या प्रदर्शन मिलेगा। temporal या विशेष multimodal workflow अपनाने वाली टीमों को अपना checkpoint और इन्फरेंस रूट अलग से जांचना चाहिए। 9
| सिस्टम का प्रकार | मुख्य उद्देश्य | U0 की स्थिति |
|---|---|---|
| रोबोट action policies | ऑब्ज़र्वेशन को रोबोट की क्रियाओं में बदलना | U0 एक upstream डेटा-जनरेशन व ऑगमेंटेशन मॉडल है, policy का विकल्प नहीं। इसके बताए downstream लाभ distribution shift में policy training बेहतर होने से जुड़े हैं। |
| रोबोट-केंद्रित world या data models | रोबोट दृश्य, ऑब्ज़र्वेशन, trajectory या simulation-जैसा डेटा बनाना | U0 का दावा है कि एक ही मॉडल scene synthesis, transfer, image editing और video-oriented rollout को कवर करता है। |
| सामान्य image generators | व्यापक टेक्स्ट/इमेज निर्माण और एडिटिंग | U0 टेक्स्ट-टू-इमेज व इमेज-टू-इमेज काम कर सकता है, लेकिन Xiaomi का जोर embodied consistency पर है; उसने समग्र इमेज-क्वालिटी में सार्वभौमिक बढ़त का व्यापक दावा नहीं किया है। |
| सामान्य video generators | सिनेमाई या विविध उपयोगों के लिए वीडियो बनाना | U0 की वीडियो क्षमता रोबोट-केंद्रित है। इसे खुले-अंत वाली वीडियो क्वालिटी में अग्रणी सामान्य वीडियो मॉडलों पर श्रेष्ठता का प्रमाण नहीं मानना चाहिए। |
Xiaomi का कहना है कि U0 ने WorldArena में पहला स्थान हासिल किया, जहां रिपोर्ट किए गए मूल्यांकन में 126 मॉडल शामिल थे। कंपनी ने instruction following, interaction quality और multi-view consistency को प्रमुख उपलब्धियों के रूप में रेखांकित किया है। Xiaomi का आधिकारिक प्रोजेक्ट पेज इसे 100 से अधिक मॉडलों में पहला बताता है। 7
10
डाउनस्ट्रीम रोबोटिक्स के लिए Xiaomi ने रिपोर्ट किया कि U0-जनित सिंथेटिक डेटा जोड़ने पर वास्तविक रोबोट की out-of-distribution (OOD) सफलता दर 36.9% से बढ़कर 63.2% हुई। यह परीक्षण अपरिचित रोशनी और पृष्ठभूमि जैसे बदलावों के संदर्भ में बताया गया है। 6
7
ये नतीजे U0 को synthetic-data augmenter के रूप में मजबूत संकेत देते हैं, लेकिन ये परियोजना द्वारा रिपोर्ट किए गए परिणाम हैं। केवल WorldArena रैंकिंग से हर रोबोट, policy, task, simulator या सामान्य image/video benchmark में श्रेष्ठता साबित नहीं होती। स्वतंत्र पुनरुत्पादन के लिए सटीक मॉडल संस्करण, prompts, sampling configuration, मूल्यांकन प्रोटोकॉल, scoring setup और तुलना किए गए मॉडल संस्करणों की जरूरत होगी। 7
10
रिपॉजिटरी, वेट्स और इन्फरेंस टूलिंग के लिए Apache-2.0 लाइसेंस U0 को पर्याप्त कंप्यूट उपलब्ध रखने वाले डेवलपर्स के लिए अपेक्षाकृत सुलभ बनाता है। फिर भी किसी भी उपयोगकर्ता को हर checkpoint का लाइसेंस व मॉडल दस्तावेज़ देखना चाहिए, और स्रोत डेटा तथा तैयार किए गए ट्रेनिंग डेटा की provenance व अनुमत उपयोग की जांच करनी चाहिए। 4
9
वीडियो जनरेशन को एकीकृत क्षमता-सेट का हिस्सा बताया गया है। हालांकि उपलब्ध रिलीज़ सामग्री यह स्थापित नहीं करती कि जुलाई की शुरुआती लॉन्च के समय video checkpoints, acceleration paths, training data और evaluation procedures हर कार्य के लिए समान रूप से पूर्ण और reproducible थे। इसलिए image तथा transfer workflows को सबसे स्पष्ट रूप से दस्तावेजीकृत deployment focus मानना बेहतर है; किसी वीडियो workflow को अपनाने से पहले उसकी उपलब्धता और प्रदर्शन जांच लें। 4
6
Xiaomi-Robotics-U0 का महत्व इस बात में कम है कि वह रोबोट कंट्रोल या सामान्य-purpose media models की जगह लेता है, और इस बात में अधिक है कि वह नियंत्रित, रोबोट-प्रासंगिक सिंथेटिक विज़ुअल डेटा बनाने के लिए एक बड़ा, एकीकृत ऑटोरेग्रेसिव पाइपलाइन खुला करता है। 38B फ्लैगशिप, बाद के छोटे वेट्स, सार्वजनिक टूलिंग और FlashAR+/vLLM पाथ इसे डेटा ऑगमेंटेशन पर काम करने वाली रिसर्च व रोबोटिक्स टीमों के लिए उपयोगी शुरुआती आधार देते हैं। 7
9
इसकी सबसे प्रभावशाली बातें—82.86× का आंतरिक इन्फरेंस तुलना-दावा, WorldArena में बढ़त और OOD policy-success का 36.9% से 63.2% तक जाना—उम्मीद जगाती हैं। लेकिन इन्हें लक्ष्य रोबोट, कार्यभार, हार्डवेयर और मूल्यांकन प्रोटोकॉल पर जांचे बिना व्यापक निष्कर्ष के रूप में नहीं लेना चाहिए। 7
10
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Xiaomi ने 15 जुलाई 2026 को 38B पैरामीटर वाला Xiaomi Robotics U0 जारी किया। यह रोबोट कंट्रोल पॉलिसी नहीं, बल्कि रोबोट ट्रेनिंग के लिए सिंथेटिक विज़ुअल डेटा बनाने और संशोधित करने वाला embodied world model है।
Xiaomi ने 15 जुलाई 2026 को 38B पैरामीटर वाला Xiaomi Robotics U0 जारी किया। यह रोबोट कंट्रोल पॉलिसी नहीं, बल्कि रोबोट ट्रेनिंग के लिए सिंथेटिक विज़ुअल डेटा बनाने और संशोधित करने वाला embodied world model है। रिलीज़ में वेट्स, इन्फरेंस टूलिंग, Gradio एंट्री पॉइंट और Apache 2.0 के तहत AR/FlashAR बैकएंड शामिल हैं। सितंबर में 4B और sequence मॉडल वेट्स तथा FSDP ट्रेनिंग कोड भी जोड़े गए।
WorldArena में शीर्ष स्थान और वास्तविक रोबोट की OOD सफलता दर 36.9% से 63.2% होने के दावे उत्साहजनक हैं, लेकिन ये परियोजना द्वारा रिपोर्ट किए गए नतीजे हैं; इन्हें हर रोबोट या जनरेशन टास्क पर स्वतंत्र श्रेष्ठता का प्रमा...