Το Omega 0 είναι ένα ενιαίο world action model για humanoid robots που προβλέπει τις μελλοντικές οπτικές συνέπειες μιας ενέργειας πριν παράγει συντονισμένες κινήσεις για πόδια, κορμό, κάμερα, χέρια και παλάμες. Η εκπαίδευση χωρίζεται σε τρία στάδια: συμπίεση whole body κινήσεων και εκμάθηση οπτικο γλωσσικών αναπαρασ...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Omega-0, the whole-body latent-prediction world action model released on August 21, 2026 by researchers from Nanyang Technological U. Article summary: Omega-0 (ω-0) is a single, whole-body “world action model” for humanoid robots: it takes a language instruction, visual observations, and robot state, predicts a future visual representation, then generates controller-co. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wate
Το Omega-0 (ω-0) είναι ένα ενιαίο whole-body world action model για humanoid robots. Αντί να αντιμετωπίζει το περπάτημα και τον χειρισμό αντικειμένων ως ξεχωριστά προβλήματα, προσπαθεί να τα συντονίσει σε μία πολιτική: το robot μπορεί να μετακινεί τη βάση του, να αλλάζει στάση και οπτική γωνία, να διατηρεί την ισορροπία του και να χρησιμοποιεί τα χέρια του στο πλαίσιο της ίδιας εργασίας. 1
Στον πυρήνα της προσέγγισης βρίσκεται η πρόβλεψη μελλοντικών οπτικών χαρακτηριστικών, όχι η άμεση παραγωγή μιας μεγάλης, προκαθορισμένης τροχιάς. Με απλά λόγια, το μοντέλο εκτιμά τι θα «δει» το robot μετά από μια ενέργεια και χρησιμοποιεί αυτή την πρόβλεψη για να επιλέξει συμβατές κινήσεις. Τα αποτελέσματα προέρχονται από ερευνητική εργασία και πρέπει να διαβάζονται ως claims των συγγραφέων, όχι ως ανεξάρτητα επιβεβαιωμένο benchmark. 1
Το πρώτο στάδιο μετατρέπει τις υψηλής διάστασης κινήσεις ολόκληρου του σώματος σε πιο συμπαγή action tokens ή latents μέσω ενός Whole-Body FAST tokenizer. Αυτή η συμπίεση δίνει στο μοντέλο έναν πιο διαχειρίσιμο τρόπο να αναπαριστά σύνθετες κινήσεις, όπως τη συνδυασμένη μετακίνηση ποδιών, κορμού και χεριών. 1
Παράλληλα, οι ερευνητές προσαρμόζουν ένα Qwen3-VL-2B-Instruct vision-language backbone στο περιβάλλον του robot. Η εκπαίδευση χρησιμοποιεί learnable tokens που διακρίνουν την egocentric, δηλαδή first-person, θέαση του robot από την exocentric, δηλαδή third-person, θέαση μιας εξωτερικής κάμερας. Έτσι, το μοντέλο μπορεί να αξιοποιεί ευρύτερη third-person εποπτεία κατά την εκπαίδευση, ενώ στη χρήση του βασίζεται στην οπτική του ίδιου του robot. 1
Στο δεύτερο στάδιο, το Omega-0 ακολουθεί έναν V-JEPA-inspired στόχο latent prediction. Συνδυάζει οπτικές πληροφορίες, γλωσσική εντολή και proprioception — τις μετρήσεις δηλαδή της κατάστασης του robot — και προβλέπει μελλοντικά visual features αντί να προσπαθεί να ανακατασκευάσει κάθε μελλοντικό pixel. 1
Ένας diffusion transformer χρησιμοποιεί στη συνέχεια αυτές τις προβλεπόμενες αναπαραστάσεις για να παράγει μια ακολουθία whole-body action latents συμβατή με τον controller. Η λογική είναι ότι η κίνηση δεν επιλέγεται μόνο επειδή φαίνεται κινηματικά πιθανή, αλλά επειδή αναμένεται να οδηγήσει σε χρήσιμη οπτική κατάσταση: για παράδειγμα, το robot μπορεί να μετακινηθεί, να προσανατολίσει το σώμα και την κάμερα και μετά να απλώσει το χέρι του προς ένα αντικείμενο. 1
Στο τρίτο στάδιο, δημόσιες ανθρώπινες επιδείξεις μεταφέρονται μέσω simulation-based grounding στον action-latent χώρο του robot. Το σύστημα προσαρμόζεται έπειτα σε πραγματικά δεδομένα από humanoid robots που εκτελούν οικιακές εργασίες. 1
Κατά την εκτέλεση, το Omega-0 δεν δεσμεύεται σε ολόκληρη την πορεία μιας μακράς εργασίας. Παράγει ένα σύντομο action chunk, το εκτελεί, παρατηρεί ξανά το περιβάλλον και σχεδιάζει εκ νέου. Αυτός ο receding-horizon τρόπος λειτουργίας επιτρέπει στο robot να διορθώνει την πορεία του με βάση νέα οπτική και proprioceptive πληροφορία, αντί να ακολουθεί μια πλήρως open-loop τροχιά. 1
Για την εκπαίδευση και την αξιολόγηση, η εργασία παρουσιάζει το Omega-HOME, ένα dataset πραγματικών οικιακών αλληλεπιδράσεων από humanoid robots. Περιλαμβάνει 40,3 ώρες δεδομένων, 4.827 tele-operated επεισόδια και 24 household tasks, καταγεγραμμένα στα 30 Hz. 1
Τα δεδομένα είναι συγχρονισμένα και περιλαμβάνουν:
Οι εργασίες οργανώνονται σε οκτώ ομάδες δυνατοτήτων:
Το σημαντικό στοιχείο είναι ότι οι δραστηριότητες δεν περιορίζονται σε στατικό tabletop grasping. Απαιτούν μετακίνηση της βάσης, αλλαγές στη στάση και στον κορμό, διατήρηση ισορροπίας και χειρισμό επίπλων, αντικειμένων ή εργαλείων σε μεγαλύτερες ακολουθίες. 1
Στο πρωτόκολλο που περιγράφεται στην εργασία, οι 11 τύποι εργασιών της αξιολόγησης αφαιρέθηκαν από τα training data του Omega-HOME. Τα υπόλοιπα δεδομένα του robot συνδυάστηκαν με δημόσιες ανθρώπινες επιδείξεις για pretraining, ενώ πραγματικά δεδομένα από σπίτια χρησιμοποιήθηκαν για το grounding και το post-training. 1
Αυτό περιορίζει τον κίνδυνο το μοντέλο να απομνημονεύει απλώς τις ίδιες επιδείξεις που εμφανίζονται στο test set. Δεν αποτελεί, όμως, απόλυτη εγγύηση γενίκευσης. Μπορεί να παραμένουν ομοιότητες σε δωμάτια, αντικείμενα, δομή εργασιών, hardware ή στον τρόπο συλλογής των δεδομένων. Η πιο αυστηρή δοκιμή θα ήταν ανεξάρτητη αναπαραγωγή σε νέα σπίτια και σε διαφορετικές πλατφόρμες humanoid robots.
Σε 11 real-home loco-manipulation tasks, οι συγγραφείς αναφέρουν 81,8% μέση επιτυχία για το Omega-0, χρησιμοποιώντας ένα ενιαίο μοντέλο αντί για ξεχωριστές πολιτικές ανά εργασία, διαφορετικά action heads ή ανεξάρτητα modules για βάδισμα και χειρισμό. 1
Οι δοκιμές κάλυπταν εργασίες όπως tabletop manipulation, καθαρισμό, laundry, μεταφορά αντικειμένων, αλληλεπίδραση με συσκευές και mobile manipulation. Η εργασία αναφέρει επίσης ότι το Omega-0 ξεπέρασε τα συγκρινόμενα baselines π-0.5, EgoVLA, GR00T-N1.7 και ψ-0 στο συγκεκριμένο test suite. 1
Το διαθέσιμο υλικό δεν τεκμηριώνει με αρκετή σαφήνεια τα ακριβή συνολικά ποσοστά κάθε baseline. Επομένως, το ασφαλές συμπέρασμα είναι η αναφερόμενη κατάταξη και το 81,8% του Omega-0 — όχι μια λεπτομερής αριθμητική σύγκριση που δεν παρουσιάζεται εδώ.
Η βασική συμβολή του Omega-0 είναι αρχιτεκτονική. Δείχνει μια κατεύθυνση στην οποία η πρόβλεψη μελλοντικών perceptual latents λειτουργεί ως σύνδεσμος ανάμεσα σε ανθρώπινες επιδείξεις, γλώσσα, όραση, proprioception και whole-body robot control. 1
Αντί να μαθαίνει μόνο «ποια κίνηση αντιστοιχεί σε αυτή την εικόνα», το μοντέλο προσπαθεί να συνδέσει την κίνηση με την κατάσταση στην οποία θα οδηγήσει. Αυτό είναι ιδιαίτερα χρήσιμο για εργασίες όπου το robot πρέπει να αποφασίσει ταυτόχρονα πού θα σταθεί, τι θα κοιτάξει και πώς θα χρησιμοποιήσει τα χέρια του.
Το αποτέλεσμα δεν σημαίνει ότι τα humanoid robots είναι έτοιμα για ανεξέλεγκτη, γενικού σκοπού λειτουργία σε σπίτια. Παραμένουν κρίσιμες αρκετές προκλήσεις:
Το πιο ακριβές συμπέρασμα είναι ότι το Omega-0 αποτελεί σημαντικό βήμα προς τον ενιαίο συντονισμό κίνησης και χειρισμού στα humanoid robots. Το 81,8% είναι ισχυρό ερευνητικό αποτέλεσμα στο συγκεκριμένο benchmark, όχι απόδειξη ότι ένα robot μπορεί ήδη να εκτελεί αξιόπιστα κάθε οικιακή εργασία χωρίς επίβλεψη.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Το Omega 0 είναι ένα ενιαίο world action model για humanoid robots που προβλέπει τις μελλοντικές οπτικές συνέπειες μιας ενέργειας πριν παράγει συντονισμένες κινήσεις για πόδια, κορμό, κάμερα, χέρια και παλάμες.
Το Omega 0 είναι ένα ενιαίο world action model για humanoid robots που προβλέπει τις μελλοντικές οπτικές συνέπειες μιας ενέργειας πριν παράγει συντονισμένες κινήσεις για πόδια, κορμό, κάμερα, χέρια και παλάμες. Η εκπαίδευση χωρίζεται σε τρία στάδια: συμπίεση whole body κινήσεων και εκμάθηση οπτικο γλωσσικών αναπαραστάσεων, πρόβλεψη μελλοντικών visual latents από όραση, γλώσσα και proprioception, και τελικό grounding σε πραγμ...
Το Omega HOME περιλαμβάνει 40,3 ώρες δεδομένων, 4.827 tele operated επεισόδια και 24 οικιακές εργασίες, με συγχρονισμένες first person και third person κάμερες, βάθος, γλώσσα, καταστάσεις robot και whole body motion d...