Enligt publicerade rapporter nådde Muka Robotics anonyma bidrag SisyphusWorld 73,06 i EWMScore P och blev tvåa på WorldArenas öppna lista. LJM låter en latent resonemangskomponent modellera konsekvenserna av robotens handlingar innan en separat videomodell återger framtida bildrutor.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did four-month-old Muka Robotics’ anonymously submitted SisyphusWorld LJM (Latent Joint-conditional Model) achieve second place globally. Article summary: Muka Robotics’ result appears to come from architectural efficiency: LJM separates predicting the physical consequences of an action from rendering a realistic video, then couples those jobs tightly rather than asking on. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Muka Robotics LJM (Latent Joint-conditional Model) är intressant inte för att den bevisar att liten datorkraft alltid slår storskalig träning. Poängen är snarare en annan fördelning av arbetet: modellen försöker först förstå vad en robothandling får för följder i den fysiska miljön, och använder sedan den förståelsen för att skapa en sammanhängande framtidsvideo.
Enligt offentliga rapporter lämnade Muka in LJM under det anonyma namnet SisyphusWorld. Modellen fick 73,06 i EWMScore_P och placerades tvåa på WorldArenas öppna rankning, efter Xiaomis UNIS på 73,64. De rapporterade delresultaten var 89,17 i Motion Quality, 92,60 i 3D Accuracy och 85,93 i Controllability. Träningen uppges ha genomförts med 32 Zhenwu 810E-GPU:er. 1
Resultatet är uppmärksammat, men underlaget som finns tillgängligt består främst av plattforms- och medieuppgifter. Det ersätter inte en öppet publicerad, oberoende reproduktion eller fullständiga ablationsstudier – alltså tester som isolerar vad varje enskild del i systemet bidrar med.
I vanliga handlingsstyrda videodiffusionsmodeller matas robotens rörelser ofta in som ett lågdimensionellt villkor till en videogenerator. Då kan videon påverkas av handlingen, men modellen måste fortfarande själv härleda vad siffervärdena betyder i praktiken: om gripdonet når ett objekt, om kontakt uppstår, om objektet flyttas och om rummets relationer förblir konsekventa.
LJM försöker göra detta steg explicit. Språkinstruktioner, tidigare visuella observationer, den aktuella ankarobservationen och planerade framtida handlingar omvandlas först till en lärbar interaktionsrepresentation i latent rum. Den representationen begränsar sedan genereringen av framtida video. 1
Det innebär inte att videogenereringen blir oviktig. Tanken är tvärtom att den visuella modellen kan lägga mer av sin kapacitet på bildmässig kontinuitet och detaljer, medan en särskild representationsdel hanterar prognosen för robot–objekt-interaktioner.
LJM består av två samverkande experter:
Ett enkelt sätt att beskriva uppdelningen är att den första experten skapar ett slags interaktionsmanus, medan den andra ansvarar för den visuella återgivningen. Det är en rimlig arkitekturell förklaring till varför modellen kan få goda resultat för rörelse, rumslig noggrannhet och styrbarhet med begränsade träningsresurser. Men det är just en förklaring, inte ett slutgiltigt kausalbevis.
En latent representation blir inte automatiskt fysiskt meningsfull bara för att den införs. Därför tränas LJM:s resonemangstoken med tre typer av prediktionsmål som kopplas till observerbara data:
Målen gör att den latenta delen inte enbart kan optimeras för snygga, trovärdiga rutor. Den måste också representera vart roboten är på väg, vilka objekt som påverkas och åt vilket håll den synliga rörelsen sker. Den offentliga beskrivningen talar om en sammanflätad övervakning av framtida robottillstånd, optiskt flöde och visuella latenter. 1
Detta garanterar inte en strikt fysikförståelse i alla situationer – exempelvis vid komplex friktion, kontakt eller skymda objekt – men det ger mer direkta signaler om interaktion än enbart videorekonstruktion.
LJM använder också delad uppmärksamhet (shared attention) i en Mixture-of-Transformers-lösning. Resonemangstoken och videotoken kan då utbyta information mellan modellens lager, i stället för att en fast villkorsvektor matas till videogeneratorn vid ett enda tillfälle. 1
Avsikten är en löpande tvåvägsanpassning:
Det är särskilt relevant för längre förlopp där objektpositioner, rörelser eller skymning förändras längs vägen. Offentliga beskrivningar redogör för mekanismen, men visar inte fristående ablationsresultat som kvantifierar just dess enskilda effekt. 1
Rapporterna beskriver träningen som genomförd med 32 Zhenwu 810E-GPU:er, i förträning på DROID och fortsatt träning på RoboTwin. 1 Den viktiga tolkningen är inte att världsmodeIler för video plötsligt är billiga, utan att LJM kan minska bördan på videogeneratorn att indirekt upptäcka interaktionsstrukturer enbart från pixlar.
Effektivitetsargumentet handlar alltså om induktiv bias: beräkningsresurser läggs på en representation med tydlig interaktionsbetydelse och på observerbara begränsningar, snarare än på att en enda videomodell samtidigt ska lära sig kontroll, rumslig struktur, objektdynamik och bildkvalitet.
Samtidigt går det inte att jämföra total beräkningsinsats enbart genom antalet GPU:er. Träningstid, datamängd, parameterantal, upplösning, parallellisering och antal träningsfaser kan skilja sig markant mellan system. Med dagens offentliga information går det därför inte att räkna ut exakt hur mycket total beräkning LJM har sparat jämfört med andra modeller.
Muka Robotics grundades enligt rapportering i april 2026 och arbetar med världsmodeIler för robotik i verkliga fysiska miljöer. Hongkong-universitetet för vetenskap och teknik-doktoranden Chi Xiaowei anges som grundare i en rapport och som medgrundare samt vd i en annan. 18
38
Däremot finns det inte tillräckligt med konsekventa och tillförlitliga uppgifter i underlaget för att fastställa hela teamets tidigare arbetsgivare eller institutionella bakgrund. Chis doktorandbakgrund har stöd i rapporteringen, men den bör inte användas för att dra slutsatser om hela teamets ursprung. 18
38
SisyphusWorlds placering stödjer en hypotes som är värd att pröva vidare: robotiska världsmodeIler behöver inte bara bli större videogeneratorer för att förbättra realism. De kan också behandla konsekvenserna av robotens handlingar som ett uttryckligt inlärningsobjekt och koppla detta tätt till videogenereringen.
Men en topplacering i en rankning bevisar inte att explicit fysisk resonemangsförmåga generellt är bättre än större träning, och den visar inte heller att LJM vinner för alla robotar, datamängder eller verkliga driftsmiljöer. För att belägga det krävs mer öppen teknisk dokumentation: ablationer av de fysiska övervakningsmålen, den delade uppmärksamheten och tvåexpertupplägget, plus tester mellan datamängder, robotplattformar och verkliga kontrollslingor.
Den mest försiktiga slutsatsen är därför att LJM presenterar en övertygande ingenjörsidé: om interaktionsprognos och visuell generering tränas tillsammans men inte blandas ihop, kan beräkningen användas mer fokuserat och samtidigt förbättra både fysisk konsekvens och visuell kvalitet. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Enligt publicerade rapporter nådde Muka Robotics anonyma bidrag SisyphusWorld 73,06 i EWMScore P och blev tvåa på WorldArenas öppna lista.
Enligt publicerade rapporter nådde Muka Robotics anonyma bidrag SisyphusWorld 73,06 i EWMScore P och blev tvåa på WorldArenas öppna lista. LJM låter en latent resonemangskomponent modellera konsekvenserna av robotens handlingar innan en separat videomodell återger framtida bildrutor.