Omega 0 er en samlet whole body world action model, der forsøger at koordinere robotten ben, overkrop, kamera, arme og hænder i én politik. Modellen forudsiger fremtidige visuelle egenskaber ud fra syn, sprog og robotdata, før en diffusion transformer genererer de nødvendige helkropsbevægelser.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Omega-0, the whole-body latent-prediction world action model released on August 21, 2026 by researchers from Nanyang Technological U. Article summary: Omega-0 (ω-0) is a single, whole-body “world action model” for humanoid robots: it takes a language instruction, visual observations, and robot state, predicts a future visual representation, then generates controller-co. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wate
Omega-0 (ω-0) er en samlet whole-body world action-model til humanoide robotter. I stedet for at behandle gang og håndtering som to separate problemer forsøger modellen at koordinere dem i én politik: Robotten kan flytte sin base, ændre kropsholdning og synsvinkel, holde balancen og bruge hænderne som dele af den samme opgave. 1
Kernen i systemet er ikke at generere en lang, fastlagt bevægelsesbane på én gang. Modellen forsøger i stedet at forudsige, hvad robotten vil kunne se efter en bestemt handling, og vælger derefter bevægelser, der passer til den forventede situation. Resultaterne stammer fra forskernes egen artikel og bør derfor læses som forfatternes rapporterede resultater – ikke som et uafhængigt bekræftet benchmark. 1
Først omdanner en Whole-Body FAST-tokenizer komplekse bevægelser for hele kroppen til mere kompakte action-tokens eller latente repræsentationer. Det giver modellen en mere håndterbar måde at beskrive bevægelser på, hvor ben, overkrop og arme arbejder sammen. 1
Forskerne tilpasser samtidig en Qwen3-VL-2B-Instruct-baseret vision-language-model til robotmiljøet. Under træningen bruger modellen lærbare tokens, der skelner mellem robot tens egocentriske førstepersonsperspektiv og et exocentrisk tredjepersonsperspektiv fra et eksternt kamera. På den måde kan den drage fordel af et bredere overblik under træningen, mens den ved brug primært navigerer ud fra robottens eget kamera. 1
I andet trin anvender Omega-0 et V-JEPA-inspireret mål for latent forudsigelse. Modellen kombinerer syn, en sproglig instruktion og proprioception – målinger af robottens egen tilstand – for at forudsige fremtidige visuelle egenskaber i stedet for at rekonstruere hver eneste pixel. 1
En diffusion-transformer bruger derefter de forudsagte repræsentationer til at generere en sekvens af helkropsbaserede action-latents, som robottens controller kan udføre. Ideen er, at en bevægelse ikke kun vælges, fordi den er fysisk mulig, men fordi den forventes at føre til en nyttig visuel situation. Robotten kan for eksempel først flytte sig og dreje krop og kamera, før den rækker ud efter en genstand. 1
I tredje trin overføres offentligt tilgængelige menneskedemonstrationer gennem simulationsbaseret grounding til robottens action-latent-rum. Derefter finjusteres systemet med virkelige data fra humanoide robotter, der udfører husholdningsopgaver. 1
Når modellen kører, planlægger den ikke nødvendigvis hele opgaven fra start til slut. Den genererer i stedet en kort action chunk, udfører den, observerer omgivelserne igen og planlægger på ny. Denne receding-horizon-strategi gør det muligt at korrigere kursen ud fra nye visuelle og proprioceptive oplysninger i stedet for at følge en lang, fastlagt bane uden feedback. 1
Til træning og evaluering præsenterer forskerne datasættet Omega-HOME, som består af virkelige interaktioner mellem humanoide robotter og hjemlige omgivelser. Det indeholder 40,3 timers data, 4.827 teleopererede episoder og 24 husholdningsopgaver, optaget ved 30 Hz. 1
Dataene er synkroniseret og omfatter:
Opgaverne er inddelt i otte kapabilitetsgrupper:
Det er væsentligt, at datasættet ikke kun handler om statisk greb om genstande på et bord. Opgaverne kræver, at robotten flytter sin base, ændrer kropsholdning og overkrop, holder balancen og håndterer møbler, genstande eller værktøj gennem længere sekvenser. 1
I det evalueringsprotokol, der beskrives i artiklen, blev de 11 opgavetyper, der indgik i testen, fjernet fra Omega-HOME’s træningsdata. De resterende robotdata blev kombineret med offentlige menneskedemonstrationer til fortræning, mens virkelige hjemmedata blev brugt til grounding og efterfølgende træning. 1
Det mindsker risikoen for, at modellen blot har lært de samme demonstrationer, som senere optræder i testen. Det er dog ikke en fuldstændig garanti for generalisering. Der kan stadig være ligheder mellem træning og test i form af rum, genstande, opgavernes struktur, hardware eller den måde, dataene blev indsamlet på. Den strengeste afprøvning vil være uafhængige gentagelser i nye hjem og på andre humanoide robotplatforme.
På 11 loco-manipulationsopgaver i virkelige hjem rapporterer forfatterne en gennemsnitlig succesrate på 81,8 procent for Omega-0. Resultatet blev opnået med én samlet model i stedet for separate politikker for hver opgave, forskellige action-heads eller uafhængige moduler til gang og håndtering. 1
Testene omfattede blandt andet bordmanipulation, rengøring, tøjvask, flytning af genstande, betjening af apparater og mobil manipulation. Artiklen rapporterer også, at Omega-0 klarede sig bedre end de sammenlignede baselines π-0.5, EgoVLA, GR00T-N1.7 og ψ-0 i det konkrete testsæt. 1
Det tilgængelige materiale dokumenterer ikke tydeligt de præcise samlede procenttal for hver baseline. Det sikre resultat er derfor den rapporterede rangering og Omega-0’s 81,8 procent – ikke en detaljeret talmæssig sammenligning, som ikke fremgår her.
Omega-0’s vigtigste bidrag er arkitekturen. Modellen viser en retning, hvor forudsigelse af fremtidige latente synsrepræsentationer kan forbinde menneskedemonstrationer, sprog, syn, proprioception og kontrol af hele robotkroppen. 1
I stedet for kun at lære, hvilken bevægelse der passer til et bestemt billede, forsøger modellen at forbinde bevægelsen med den situation, den forventes at føre til. Det er især relevant, når robotten samtidig skal beslutte, hvor den skal stå, hvad den skal se på, og hvordan den skal bruge hænderne.
Resultatet betyder dog ikke, at humanoide robotter allerede er klar til ukontrolleret drift i almindelige hjem. Flere udfordringer er fortsat centrale:
Den mest præcise konklusion er derfor, at Omega-0 er et vigtigt skridt mod en samlet koordinering af bevægelse og håndtering i humanoide robotter. De 81,8 procent er et stærkt forskningsresultat på det konkrete benchmark – men ikke et bevis på, at en robot allerede kan udføre enhver husholdningsopgave stabilt og uden opsyn.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Omega 0 er en samlet whole body world action model, der forsøger at koordinere robotten ben, overkrop, kamera, arme og hænder i én politik.
Omega 0 er en samlet whole body world action model, der forsøger at koordinere robotten ben, overkrop, kamera, arme og hænder i én politik. Modellen forudsiger fremtidige visuelle egenskaber ud fra syn, sprog og robotdata, før en diffusion transformer genererer de nødvendige helkropsbevægelser.
Datasættet Omega HOME indeholder 40,3 timers data, 4.827 teleopererede episoder og 24 husholdningsopgaver.