Omega 0 je jednotný „world action model“ pro humanoidní roboty, který koordinuje pohyb nohou, trupu, kamery i rukou místo použití oddělených politik. Model nejprve předpovídá budoucí vizuální stav prostředí a teprve poté generuje krátký úsek pohybu celého těla.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Omega-0, the whole-body latent-prediction world action model released on August 21, 2026 by researchers from Nanyang Technological U. Article summary: Omega-0 (ω-0) is a single, whole-body “world action model” for humanoid robots: it takes a language instruction, visual observations, and robot state, predicts a future visual representation, then generates controller-co. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wate
Omega-0 (ω-0) je jednotný world action model pro celé tělo humanoidních robotů. Nesnaží se řešit chůzi a uchopování jako dvě oddělené úlohy. Místo toho je propojuje do jedné řídicí politiky: robot může změnit svou pozici, upravit postoj a úhel pohledu, udržet rovnováhu a zároveň používat ruce při plnění stejného úkolu. 1
Klíčová myšlenka spočívá v předpovídání budoucích vizuálních vlastností prostředí, nikoli v okamžitém naplánování jediné dlouhé a předem dané trajektorie. Zjednodušeně řečeno, model odhaduje, co robot po určitém pohybu uvidí, a podle toho vybírá další kompatibilní akce. Výsledky pocházejí z výzkumné práce a je třeba je chápat jako tvrzení jejích autorů, nikoli jako nezávisle ověřený benchmark. 1
První fáze převádí vysokodimenzionální pohyby celého těla do kompaktnějších akčních tokenů neboli latentních reprezentací pomocí Whole-Body FAST tokenizeru. Model tak získá lépe zvládnutelný způsob, jak popsat složité pohyby, například současnou práci nohou, trupu a paží. 1
Výzkumníci zároveň přizpůsobují robotickému prostředí multimodální model Qwen3-VL-2B-Instruct. Do tréninku přidávají naučitelné tokeny, které rozlišují egocentrický pohled z kamery robota od exocentrického, tedy pohledu z externí kamery. Během učení tak může systém využít širší pohled třetí osoby, zatímco při samotném nasazení vychází z obrazu, který vidí robot. 1
Ve druhé fázi Omega-0 využívá cíl inspirovaný metodou V-JEPA. Spojuje obrazové informace, jazykový pokyn a propriocepci — tedy měření aktuálního stavu vlastního těla robota — a předpovídá budoucí vizuální příznaky. Nesnaží se přitom rekonstruovat každý budoucí pixel. 1
Diffusion transformer pak z těchto předpovězených reprezentací generuje sekvenci latentních akcí celého těla, které odpovídají možnostem řídicího systému. Pohyb tedy není vybrán jen proto, že je kinematicky možný, ale také proto, že by měl vést k užitečnému vizuálnímu výsledku. Robot se například může nejprve přesunout, natočit tělo a kameru a teprve potom natáhnout ruku k předmětu. 1
Ve třetí fázi se veřejné demonstrace lidí pomocí simulace převádějí do latentního prostoru akcí konkrétního robota. Systém se následně dolaďuje na reálných datech humanoidních robotů při provádění domácích úloh. 1
Při provozu se model nezaváže k celé dlouhé posloupnosti úkonů. Vytvoří krátký akční blok, provede ho, znovu zkontroluje prostředí a plán přepočítá. Tento způsob řízení s posouvaným horizontem umožňuje robotovi reagovat na nové obrazové i proprioceptivní informace a opravovat svou trajektorii namísto slepého následování předem připraveného plánu. 1
Pro trénink i hodnocení práce představuje dataset Omega-HOME, který zachycuje skutečné domácí interakce humanoidních robotů. Obsahuje 40,3 hodiny dat, 4 827 teleoperovaných epizod a 24 domácích úloh, zaznamenaných s frekvencí 30 Hz. 1
Data jsou synchronizovaná a zahrnují:
Úlohy jsou rozděleny do osmi skupin:
Nejde tedy jen o statické uchopování předmětů na stole. Robot musí přesouvat základnu, měnit postoj a polohu trupu, udržovat rovnováhu a v delších sekvencích pracovat s nábytkem, předměty nebo nástroji. 1
Podle protokolu popsaného v práci bylo 11 typů úloh použitých při hodnocení odstraněno z trénovacích dat Omega-HOME. Zbývající robotická data byla pro předtrénování zkombinována s veřejnými demonstracemi lidí. Reálná domácí data pak posloužila k uzemnění modelu v robotovi a k následnému tréninku. 1
Tento postup snižuje riziko, že si model pouze zapamatoval stejné demonstrace, které se objevily v testu. Nepředstavuje však absolutní záruku zobecnitelnosti. Mezi tréninkem a testem mohou zůstat podobnosti v místnostech, předmětech, struktuře úloh, použitém hardwaru nebo způsobu sběru dat. Přísnější prověrkou by bylo nezávislé zopakování testu v nových domácnostech a na jiných platformách humanoidních robotů.
V 11 úlohách lokomoční manipulace v reálných domácnostech autoři uvádějí pro Omega-0 průměrnou úspěšnost 81,8 %. Systém přitom využívá jeden společný model namísto samostatných politik pro jednotlivé úlohy, různých akčních hlav nebo oddělených modulů pro chůzi a manipulaci. 1
Testy zahrnovaly například manipulaci na stole, čištění, práci s prádlem, přenášení předmětů, ovládání spotřebičů a mobilní manipulaci. Práce rovněž uvádí, že Omega-0 v dané testovací sadě překonal porovnávané baseline modely π-0.5, EgoVLA, GR00T-N1.7 a ψ-0. 1
Dostupné podklady ale dostatečně jasně neuvádějí přesná celková procenta úspěšnosti jednotlivých baseline modelů. Opatrný závěr proto zní: autoři uvádějí prvenství Omega-0 a jeho výsledek 81,8 %, nikoli detailní číselné srovnání, které zde není doloženo.
Hlavní přínos Omega-0 je architektonický. Výzkum ukazuje směr, v němž může předpovídání budoucích latentních vizuálních stavů propojovat lidské demonstrace, jazyk, vidění, propriocepci a řízení celého těla robota. 1
Model se neučí pouze odpověď na otázku „jaký pohyb odpovídá tomuto obrazu“. Snaží se také spojit pohyb se stavem, do něhož robot následně dospěje. To je důležité u úloh, při nichž musí současně rozhodnout, kde stát, kam se dívat a jak použít ruce.
Výsledek ale neznamená, že humanoidní roboti jsou připraveni k nekontrolovanému provozu v domácnostech. Zůstává několik zásadních problémů:
Nejpřesnější závěr tedy je, že Omega-0 představuje významný krok k jednotnému řízení pohybu a manipulace u humanoidních robotů. Úspěšnost 81,8 % je silný výzkumný výsledek v konkrétním benchmarku, nikoli důkaz, že robot už dokáže bez dohledu spolehlivě provádět libovolné domácí úkoly.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Omega 0 je jednotný „world action model“ pro humanoidní roboty, který koordinuje pohyb nohou, trupu, kamery i rukou místo použití oddělených politik.
Omega 0 je jednotný „world action model“ pro humanoidní roboty, který koordinuje pohyb nohou, trupu, kamery i rukou místo použití oddělených politik. Model nejprve předpovídá budoucí vizuální stav prostředí a teprve poté generuje krátký úsek pohybu celého těla.
Dataset Omega HOME obsahuje 40,3 hodiny dat, 4 827 teleoperovaných epizod a 24 domácích úloh v osmi kategoriích.