Omega 0 एक unified whole body world action model है, जो locomotion और object manipulation को अलग अलग समस्याओं के बजाय एक ही नीति में जोड़ता है। [1] इसकी तीन चरणीय architecture में Whole Body FAST tokenizer, Qwen3 VL 2B Instruct आधारित vision language training और future visual latents की भविष्यवाणी शामिल है। [1] Omeg...
शोध उत्तर

Create a landscape editorial hero image for this Studio Global article: What is Omega-0, the whole-body latent-prediction world action model released on August 21, 2026 by researchers from Nanyang Technological U. Article summary: Omega-0 (ω-0) is a single, whole-body “world action model” for humanoid robots: it takes a language instruction, visual observations, and robot state, predicts a future visual representation, then generates controller-co. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wate
Omega-0 (ω-0) ह्यूमनॉइड रोबोट के लिए बनाया गया एक unified whole-body world action model है। इसका लक्ष्य यह है कि रोबोट चलने, अपना संतुलन बनाए रखने, कैमरे की दिशा बदलने और हाथों से वस्तुएँ संभालने जैसे कामों को अलग-अलग modules के जरिए नहीं, बल्कि एक ही समन्वित policy के रूप में करे। 1
सरल शब्दों में, मॉडल केवल यह नहीं सीखता कि किसी दृश्य में हाथ को कहाँ ले जाना है। यह पहले अनुमान लगाने की कोशिश करता है कि किसी कार्रवाई के बाद रोबोट को दुनिया कैसी दिखाई देगी—फिर उस अपेक्षित परिणाम तक पहुँचने वाली पूरे शरीर की गतिविधियाँ तैयार करता है। ये परिणाम शोध-पत्र में लेखकों द्वारा रिपोर्ट किए गए हैं; इन्हें स्वतंत्र रूप से सत्यापित benchmark परिणाम नहीं माना जाना चाहिए। 1
पहले चरण में Whole-Body FAST tokenizer उच्च-आयामी whole-body motion trajectories को छोटे action tokens या latents में compress करता है। इससे पैरों, धड़, सिर और हाथों की एक साथ होने वाली जटिल गतिविधियों को मॉडल के लिए संभालना आसान हो जाता है। 1
इसके साथ researchers ने Qwen3-VL-2B-Instruct vision-language backbone को robot के वातावरण के लिए adapt किया। इसमें ऐसे learnable tokens शामिल हैं, जो robot के अपने camera view यानी egocentric/first-person दृश्य और बाहर से रिकॉर्ड किए गए exocentric/third-person दृश्य के बीच अंतर बताते हैं। इस तरह training के दौरान मॉडल third-person supervision का लाभ उठा सकता है, जबकि deployment के समय robot मुख्यतः अपनी camera view पर निर्भर करता है। 1
दूसरे चरण में Omega-0, V-JEPA-inspired latent prediction objective का इस्तेमाल करता है। मॉडल vision, language instruction और proprioception—यानी robot की अपनी स्थिति, joint और movement measurements—को मिलाकर भविष्य के visual features का अनुमान लगाता है। यह हर pixel को दोबारा बनाने के बजाय दृश्य की उपयोगी latent representation की भविष्यवाणी करता है। 1
इसके बाद एक diffusion transformer इन predicted visual features के आधार पर controller-compatible whole-body action latents तैयार करता है। इसका उद्देश्य ऐसी गतिविधि चुनना है, जो केवल शरीर की दृष्टि से संभव न हो, बल्कि robot को अपेक्षित उपयोगी दृश्य स्थिति तक भी ले जाए। उदाहरण के लिए, robot पहले अपने पैरों और धड़ को सही जगह ला सकता है, camera को वस्तु की ओर मोड़ सकता है और फिर हाथ बढ़ाकर उसे उठा सकता है। 1
तीसरे चरण में सार्वजनिक human demonstrations को simulation-based grounding के जरिए robot के action-latent space में transfer किया जाता है। इसके बाद वास्तविक घरों में humanoid robots द्वारा किए गए household tasks के data से system को fine-tune किया जाता है। 1
काम करते समय मॉडल पूरी लंबी trajectory पहले से तय करके open-loop तरीके से नहीं चलता। इसके बजाय वह छोटा action chunk बनाता है, उसे execute करता है, environment को फिर से देखता है और अगला कदम दोबारा plan करता है। इसे receding-horizon control कहा जाता है। इससे नई visual या proprioceptive जानकारी मिलने पर robot अपनी दिशा और गति सुधार सकता है। 1
शोध-पत्र के अनुसार, training और evaluation के लिए बनाए गए Omega-HOME dataset में 40.3 घंटे का data, 4,827 tele-operated episodes और 24 household tasks शामिल हैं। Data 30 Hz पर record किया गया है। 1
इसमें synchronized रूप से शामिल हैं:
इन tasks को आठ capability groups में बाँटा गया है:
यह dataset केवल मेज पर रखी वस्तु को पकड़ने जैसे static tabletop tasks तक सीमित नहीं है। कई कार्यों में robot को अपना base आगे बढ़ाना, posture और torso बदलना, संतुलन बनाए रखना तथा furniture, objects या tools को लंबी sequences में संभालना पड़ता है। 1
शोध-पत्र में बताए गए evaluation protocol के तहत Omega-HOME से evaluation में इस्तेमाल किए गए 11 task types को training data से हटा दिया गया। बाकी robot data को public human demonstrations के साथ pretraining के लिए जोड़ा गया, जबकि वास्तविक घरों का data grounding और post-training में इस्तेमाल हुआ। 1
इससे यह जोखिम कम होता है कि मॉडल test set में दिखाए गए उन्हीं demonstrations को केवल याद कर रहा हो। फिर भी यह generalization की पूर्ण गारंटी नहीं है। Training और test के बीच कमरे, वस्तुएँ, task structure, robot hardware या data collection की शैली में कुछ समानताएँ रह सकती हैं। नए घरों और अलग humanoid platforms पर स्वतंत्र replication अधिक कठोर परीक्षण होगा।
11 real-home loco-manipulation tasks में लेखकों ने Omega-0 के लिए 81.8% औसत single-model success rate रिपोर्ट किया है। इसका अर्थ है कि एक unified model ने अलग-अलग tasks के लिए अलग policies, action heads या walking और manipulation के लिए स्वतंत्र modules के बिना काम किया। 1
Evaluation में tabletop manipulation, cleaning, laundry, object transfer, appliance interaction और mobile manipulation जैसे tasks शामिल थे। शोध-पत्र के अनुसार Omega-0 ने इसी test suite में तुलना किए गए π-0.5, EgoVLA, GR00T-N1.7 और ψ-0 baselines से बेहतर प्रदर्शन किया। 1
उपलब्ध source material में हर baseline के सटीक aggregate percentages पर्याप्त स्पष्टता से नहीं दिए गए हैं। इसलिए सुरक्षित निष्कर्ष यही है कि paper Omega-0 के लिए 81.8% का आंकड़ा और इन baselines के मुकाबले बेहतर ranking रिपोर्ट करता है—इससे आगे की विस्तृत संख्यात्मक तुलना करना उचित नहीं होगा। 1
Omega-0 का सबसे महत्वपूर्ण योगदान इसका architectural approach है। यह दिखाता है कि future perceptual latents की prediction, human demonstrations, language, vision, proprioception और whole-body robot control के बीच एक पुल का काम कर सकती है। 1
व्यावहारिक रूप से इसका मतलब है कि robot एक ही task के दौरान यह तय करने की कोशिश कर सकता है कि उसे कहाँ खड़ा होना है, किस दिशा में देखना है और हाथों का इस्तेमाल कैसे करना है। यही वह समन्वय है जो मनुष्य रोजमर्रा के कामों में सहज रूप से करते हैं, लेकिन robots के लिए अब तक इसे अलग-अलग subproblems में बाँटना पड़ता था।
फिर भी 81.8% का परिणाम यह साबित नहीं करता कि humanoid robots अब बिना निगरानी हर घर का काम कर सकते हैं। कई चुनौतियाँ अभी बाकी हैं:
सबसे सटीक निष्कर्ष यह है कि Omega-0 humanoid robots में walking और manipulation के एकीकृत coordination की दिशा में मजबूत शोध-परिणाम है। इसका 81.8% score इस खास benchmark पर प्रभावशाली है, लेकिन यह अभी general-purpose, unsupervised घरेलू robot के तैयार हो जाने का प्रमाण नहीं है।
Studio Global AI
इस पृष्ठ में एक स्रोत-समर्थित उत्तर शामिल है जिसे आप Studio Global के अंदर जारी रख सकते हैं।
Omega 0 एक unified whole body world action model है, जो locomotion और object manipulation को अलग अलग समस्याओं के बजाय एक ही नीति में जोड़ता है। [1]
Omega 0 एक unified whole body world action model है, जो locomotion और object manipulation को अलग अलग समस्याओं के बजाय एक ही नीति में जोड़ता है। [1] इसकी तीन चरणीय architecture में Whole Body FAST tokenizer, Qwen3 VL 2B Instruct आधारित vision language training और future visual latents की भविष्यवाणी शामिल है। [1]
Omega HOME dataset में 40.3 घंटे का डेटा, 4,827 tele operated episodes और 24 घरेलू कार्य शामिल हैं। [1]