Anonymní příspěvek SisyphusWorld od Muka Robotics dosáhl podle zveřejněných informací ve WorldArena skóre EWMScore P 73,06 a druhého místa za Xiaomi UNIS se skóre 73,64. LJM nejprve vytváří v latentním prostoru reprezentaci očekávaného průběhu interakce robota s okolím a teprve poté z ní generuje budoucí video.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did four-month-old Muka Robotics’ anonymously submitted SisyphusWorld LJM (Latent Joint-conditional Model) achieve second place globally. Article summary: Muka Robotics’ result appears to come from architectural efficiency: LJM separates predicting the physical consequences of an action from rendering a realistic video, then couples those jobs tightly rather than asking on. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Pozornost kolem modelu LJM (Latent Joint-conditional Model) od společnosti Muka Robotics nevzbudilo tvrzení, že malý výpočet vždy porazí velký. Podstatnější je jiný způsob rozdělení práce: model se má zvlášť učit, jaké fyzické následky bude mít robotická akce, a zvlášť, jak tyto následky převést do souvislého videa.
Podle zveřejněných zpráv Muka odeslala LJM do žebříčku WorldArena pod anonymním názvem SisyphusWorld. Model získal EWMScore_P 73,06 a obsadil druhé místo za Xiaomi UNIS se skóre 73,64. Uváděné dílčí výsledky jsou 89,17 za kvalitu pohybu, 92,60 za 3D přesnost a 85,93 za ovladatelnost; k tréninku mělo být použito 32 GPU Zhenwu 810E.1
Tyto výsledky stojí za pozornost, ale je namístě opatrnost: dostupné podklady vycházejí hlavně z materiálů platformy a médií. Nenahrazují úplnou nezávislou reprodukci ani veřejnou ablační studii, která by oddělila přínos jednotlivých částí systému.
Běžné difuzní modely pro video řízené akcí robota často předávají akci jako nízkorozměrný vstup do generátoru videa. Video se pak sice může měnit podle pohybu robota, ale samotný generátor musí z obrazových tréninkových cílů nepřímo odvodit, co čísla akce znamenají: zda rameno navázalo kontakt s předmětem, zda chapadlo předmět uchopilo, kam se posune a zda zůstanou zachovány prostorové vztahy.
LJM se pokouší tuto mezivrstvu výslovně modelovat. Jazykový pokyn, vizuální historii, aktuální kotevní pozorování a plánované budoucí akce nejprve převádí na učitelnou latentní reprezentaci interakce. Ta následně omezuje generování budoucího videa.1
Generátor videa tedy nemá sám nést celou zátěž porozumění akci, predikce interakce i vykreslení obrazu. Má se více soustředit na vizuální kontinuitu a detaily, zatímco vrstva latentní reprezentace předpovídá vztah robota a objektů.
LJM spojuje dva spolupracující „experty“:
Prakticky si to lze představit jako spojení „scénáře interakce“ a obrazového vykreslování. První část popisuje pravděpodobné důsledky akce, druhá z nich vytváří věrohodnou vizuální budoucnost. To je rozumné architektonické vysvětlení, proč by model mohl při omezených zdrojích dosahovat dobrých výsledků v pohybu, prostoru a ovladatelnosti. Není to ale ještě konečný důkaz příčinného efektu.
Samotná latentní proměnná nezaručuje, že bude skutečně zachycovat fyzikální dění. LJM proto na latentní tokeny aplikuje tři typy predikčních omezení, které odpovídají pozorovatelným datům:
Smyslem je, aby latentní plán nesloužil jen k tvorbě snímků, které vypadají uvěřitelně. Musí také zachycovat, kam robot míří, které objekty se mění a jakým směrem se obrazový pohyb vyvíjí. Zveřejněné materiály tento princip popisují jako propojené dozorování budoucího stavu robota, optického toku a vizuálních latentních proměnných.1
Takové omezení samozřejmě nezaručuje dokonalé porozumění kontaktům, tření nebo zakrytí objektů v každé situaci. Oproti čisté rekonstrukci videa však poskytuje přímější tréninkový signál pro robotickou interakci.
LJM používá sdílenou pozornost ve stylu Mixture-of-Transformers. Tokeny latentního uvažování a video tokeny si tak mohou v jednotlivých vrstvách vyměňovat informace. Nejde jen o jednorázové předání pevného podmiňovacího vektoru generátoru videa.1
Záměrem je průběžná obousměrná koordinace:
To by mělo být vhodnější pro delší děje, v nichž se během generování mění poloha objektu, míra zakrytí nebo stav pohybu. Veřejné materiály mechanismus popisují, neposkytují však nezávislou ablační analýzu, která by samostatně vyčíslila jeho přínos.1
Zprávy popisují trénink LJM na 32 GPU Zhenwu 810E, a to při předtrénování na datech DROID i dalším tréninku na RoboTwin.1 Z toho neplyne, že by tvorba video světových modelů byla levná. Důležitější interpretace je, že tato architektura může snížit potřebu, aby generátor z pixelů sám nepřímo objevoval strukturu robotických interakcí.
Jde tedy o argument založený na induktivním zkreslení: výpočetní kapacita se věnuje latentní reprezentaci s jasným významem pro interakci a jejím měřitelným omezením, místo aby jeden monolitický video model současně objevoval řízení akcí, prostorovou strukturu, dynamiku objektů a obrazovou kvalitu.
Samotný počet GPU ale neumožňuje přímé srovnání celkových tréninkových nákladů. Ty závisí také na době tréninku, rozsahu dat, velikosti modelu, rozlišení, efektivitě paralelizace a jednotlivých fázích tréninku. Z dostupných informací proto nelze spolehlivě spočítat, kolik celkového výpočtu LJM oproti jiným systémům ušetřil.
Podle veřejných zpráv byla Muka Robotics založena v dubnu 2026 a zaměřuje se na robotické světové modely pro reálný fyzický svět. Jako zakladatel je uváděn doktorand či absolvent doktorského studia Hongkongské univerzity vědy a technologie (HKUST) Čch’ Siao-wej; v jedné zprávě je označen také jako spoluzakladatel a CEO.18
38
Dostupné materiály však neposkytují dostatečně spolehlivý a jednotný přehled původu celého týmu – například předchozích firem či laboratoří všech jeho členů. Podložené je tedy spojení Čch’ Siao-weje s HKUST, nikoli širší závěry o kompletní personální historii týmu.18
38
Výkon SisyphusWorld v žebříčku podporuje směr, který si zaslouží další ověření: robotický světový model nemusí zvyšovat realističnost pouze škálováním video generátoru. Alternativou je učit se důsledky interakce explicitně a těsně je propojit s generováním videa.
Pořadí v žebříčku ale samo o sobě nedokazuje, že explicitní fyzikální uvažování už obecně překonává škálování, ani že LJM bude lepší pro všechny roboty, datové distribuce a nasazení v reálné uzavřené řídicí smyčce. K ověření by byly potřeba podrobnější veřejné technické podklady: ablace fyzikálních dozorovacích cílů, sdílené pozornosti i rozdělení na dva experty, stejně jako testy napříč datovými sadami, robotickými platformami a reálným řízením.
Nejstřízlivější závěr zatím zní: LJM předkládá přesvědčivou inženýrskou hypotézu, podle níž může společné, ale ne slité učení predikce interakcí a vizuální generace soustředit výpočetní rozpočet účelněji a zároveň zlepšit fyzikální konzistenci i kvalitu obrazu.1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Anonymní příspěvek SisyphusWorld od Muka Robotics dosáhl podle zveřejněných informací ve WorldArena skóre EWMScore P 73,06 a druhého místa za Xiaomi UNIS se skóre 73,64.
Anonymní příspěvek SisyphusWorld od Muka Robotics dosáhl podle zveřejněných informací ve WorldArena skóre EWMScore P 73,06 a druhého místa za Xiaomi UNIS se skóre 73,64. LJM nejprve vytváří v latentním prostoru reprezentaci očekávaného průběhu interakce robota s okolím a teprve poté z ní generuje budoucí video.
Výsledky jsou zajímavým argumentem pro explicitní modelování interakcí, nejsou však samy o sobě nezávislým důkazem, že je tento přístup univerzálně lepší než větší a výpočetně náročnější modely.