Muka Robotics indsendte anonymt modellen SisyphusWorld, som ifølge offentliggjorte omtaler fik 73,06 i EWMScore P og andenpladsen på WorldArenas offentlige rangliste. LJM lader et særskilt latent lag forudsige robot objekt interaktioner, før en videomodel visualiserer resultatet.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did four-month-old Muka Robotics’ anonymously submitted SisyphusWorld LJM (Latent Joint-conditional Model) achieve second place globally. Article summary: Muka Robotics’ result appears to come from architectural efficiency: LJM separates predicting the physical consequences of an action from rendering a realistic video, then couples those jobs tightly rather than asking on. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Muka Robotics’ LJM (Latent Joint-conditional Model) er interessant, ikke fordi den beviser, at få GPU’er altid slår store træningskørsler, men fordi den fordeler arbejdet anderledes: Modellen forsøger først at udlede, hvad en handling gør ved den fysiske scene, og bruger derefter den viden til at generere en sammenhængende video.
Ifølge offentliggjorte omtaler blev LJM indsendt under det anonyme navn SisyphusWorld og opnåede 73,06 i EWMScore_P på WorldArenas offentlige rangliste. Det rakte til andenpladsen, lige efter Xiaomi UNIS med 73,64. Omtalerne angiver desuden 89,17 i Motion Quality, 92,60 i 3D Accuracy og 85,93 i Controllability samt træning på 32 Zhenwu 810E-GPU’er. 1 Tallene er opsigtsvækkende, men den tilgængelige dokumentation består især af platform- og medieomtale – ikke af en komplet, uafhængigt reproduceret teknisk evaluering.
I mange handlingsbetingede videodiffusionsmodeller tilføjes robotens handlinger som et lavdimensionelt input til videogeneratoren. Det kan få videoen til at følge bevægelsen, men modellen skal stadig selv lære, hvad handlingstallene betyder i praksis: Om griberen rammer et objekt, om objektet løftes, hvor det flytter sig hen, og om de rumlige relationer holder over tid.
LJM forsøger at gøre dette led eksplicit. Sproginstruktioner, tidligere billeder, en aktuel ankerobservation og planlagte fremtidige handlinger omsættes først til et lært interaktionslatent. Det bruges derefter til at begrænse genereringen af fremtidige videobilleder. 1
Pointen er ikke, at videogenerering bliver mindre vigtig. Tværtimod skal videogeneratoren i højere grad bruge kapaciteten på visuel kontinuitet og detaljer, mens et særskilt repræsentationslag tager sig af at forudsige samspillet mellem robot og omgivelser.
LJM består af to samarbejdende moduler:
En enkel måde at forstå det på er som et samspil mellem et interaktionsmanuskript og en visuel rendering. Det første beskriver konsekvenserne af handlingen; det andet viser dem. Den arbejdsdeling er en plausibel forklaring på, at modellen kan præstere stærkt på bevægelse, rumlighed og styrbarhed med afgrænsede træningsressourcer – men den er ikke i sig selv et endeligt bevis for årsagssammenhængen.
Et latent lag bliver ikke automatisk fysisk meningsfuldt. Derfor beskrives LJM med tre typer forudsigelseskrav, der knytter token-repræsentationerne til observerbare data:
Det betyder, at repræsentationen ikke kun skal hjælpe med at skabe billeder, der ser troværdige ud. Den skal også forklare, hvor robotten bevæger sig hen, hvilke objekter der ændrer sig, og hvilken retning bevægelsen tager på skærmen. Materialet beskriver dette som sammenflettet supervision af fremtidig robottilstand, optisk flow og visuelle latenter. 1
Det garanterer ikke en fuld fysisk forståelse i alle situationer med eksempelvis friktion, kontakt eller tildækning. Men det giver træningen mere direkte signaler om interaktion end ren videogenskabelse alene.
LJM anvender også delt attention i en Mixture-of-Transformers-opsætning. Her kan ræsonnementstokens og videotokens udveksle information gennem modellens lag, i stedet for at et fast betingelsessignal blot sendes én vej til videogeneratoren. 1
Det er tænkt som en løbende, tovejs koordination:
Sammenlignet med en fast, ensrettet betingelse kan den lagvise udveksling i princippet bedre håndtere situationer, hvor objekters placering, bevægelse eller synlighed ændrer sig undervejs. Offentligt materiale beskriver mekanismen, men fremlægger ikke uafhængige ablationer, der isolerer dens præcise bidrag. 1
Omtalerne angiver, at LJM blev trænet med 32 Zhenwu 810E-GPU’er, blandt andet i DROID-fortræning og efterfølgende træning på RoboTwin. 1 Den centrale pointe er ikke, at verdensmodeller for video pludselig er blevet billige. Snarere er hypotesen, at videogeneratoren får mindre af byrden med selv at opdage interaktionsstrukturer indirekte fra pixels.
Effektivitetspåstanden handler dermed om induktiv bias: Beregningen rettes mod en repræsentation med en tydelig interaktionsbetydning og mod konkrete, observerbare begrænsninger – frem for at ét samlet videonetværk samtidig skal lære styring, rumstruktur, objektbevægelse og billedkvalitet.
Antallet af GPU’er kan dog ikke alene bruges til at sammenligne den samlede beregningsmængde mellem systemer. Træningstid, datasætstørrelse, modelstørrelse, opløsning, parallelisering og træningsfaser kan være meget forskellige. De tilgængelige oplysninger er derfor ikke nok til at beregne, hvor meget samlet regnekraft LJM eventuelt sparer i forhold til andre modeller.
Offentlige omtaler angiver, at Muka Robotics blev etableret i april 2026 med fokus på robotverdensmodeller for den fysiske verden. Chi Xiaowei, der har en ph.d. fra Hong Kong University of Science and Technology, nævnes som grundlægger; en anden omtale beskriver ham som medstifter og CEO. 18
38
Der er derimod ikke tilstrækkeligt pålidelige og ensartede oplysninger i det foreliggende materiale til at fastslå hele teamets baggrund eller tidligere arbejdsgivere. Det mest forsvarlige er derfor at holde sig til den offentligt omtalte ph.d.-baggrund for Chi Xiaowei og undlade bredere slutninger om resten af holdet. 18
38
SisyphusWorlds placering på ranglisten understøtter en retning, der er værd at følge: Robotverdensmodeller behøver ikke kun at blive større for at jagte mere realistisk video. De kan også lære konsekvenserne af interaktion eksplicit og koble dem tæt til videogenereringen.
Men en placering på en rangliste beviser ikke, at eksplicit fysisk ræsonnement generelt er bedre end større træningsskala – og heller ikke at LJM vil være bedst på tværs af robottyper, datasæt eller virkelige, lukkede kontrolsløjfer. Det kræver mere omfattende teknisk dokumentation, herunder ablationer af de fysiske mål, den delte opmærksomhed og todelingen mellem eksperter samt test på tværs af datasæt og robotplatforme.
Den nøgterne konklusion er derfor: LJM fremsætter en overbevisende ingeniørhypotese om, at en model muligvis kan forbedre både fysisk konsistens og visuel kvalitet ved at træne interaktionsforudsigelse og videogenerering sammen – men uden at blande de to opgaver helt sammen. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Muka Robotics indsendte anonymt modellen SisyphusWorld, som ifølge offentliggjorte omtaler fik 73,06 i EWMScore P og andenpladsen på WorldArenas offentlige rangliste.
Muka Robotics indsendte anonymt modellen SisyphusWorld, som ifølge offentliggjorte omtaler fik 73,06 i EWMScore P og andenpladsen på WorldArenas offentlige rangliste. LJM lader et særskilt latent lag forudsige robot objekt interaktioner, før en videomodel visualiserer resultatet.
Resultatet peger på en interessant arkitektur, men dokumentationen er foreløbig primært platform og medieomtale.