Volgens openbare berichtgeving behaalde Muka Robotics’ anonieme inzending SisyphusWorld een EWMScore P van 73,06 op WorldArena, goed voor de tweede plaats achter Xiaomi UNIS met 73,64. LJM laat een redeneerexpert eerst de gevolgen van robotacties in een latente ruimte voorspellen.
Gepubliceerd doorBewerkt met GPT-5.6 TerraAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How did four-month-old Muka Robotics’ anonymously submitted SisyphusWorld LJM (Latent Joint-conditional Model) achieve second place globally. Article summary: Muka Robotics’ result appears to come from architectural efficiency: LJM separates predicting the physical consequences of an action from rendering a realistic video, then couples those jobs tightly rather than asking on. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
De opvallende prestatie van Muka Robotics’ LJM (Latent Joint-conditional Model) is niet dat een klein trainingsbudget per definitie beter zou zijn dan grootschalige training. De relevantie zit in een andere verdeling van het rekenwerk: eerst voorspellen wat een robotactie fysiek met de omgeving doet, en pas daarna die voorspelde gevolgen als samenhangende video weergeven.
Volgens openbare berichtgeving diende Muka het model onder de anonieme naam SisyphusWorld in. Het behaalde op de openbare WorldArena-ranglijst een EWMScore_P van 73,06, waarmee het tweede werd, achter Xiaomi UNIS met 73,64. De gemelde deelscores zijn 89,17 voor Motion Quality, 92,60 voor 3D Accuracy en 85,93 voor Controllability. De training zou zijn uitgevoerd op 32 Zhenwu 810E-GPU’s. 1
Dat zijn resultaten die aandacht verdienen, maar de beschikbare onderbouwing bestaat vooralsnog vooral uit platform- en mediaberichtgeving. Zij vervangt geen volledig openbaar, onafhankelijk reproduceerbaar onderzoek met uitgebreide ablaties.
Bij veel actiegestuurde videodiffusiemodellen wordt de robotactie als een laagdimensionale voorwaarde aan een videogenerator toegevoegd. Daardoor kan de video op de actie reageren, maar het model moet uit videodata en pixelgerichte trainingsdoelen nog steeds zelf afleiden wat de getallen fysiek betekenen: raakt een robotarm een object, grijpt de grijper het vast, waarheen verplaatst het object zich en blijven ruimtelijke relaties consistent?
LJM probeert die tussenstap expliciet te modelleren. Het zet een taalopdracht, visuele voorgeschiedenis, een actuele ankerwaarneming en toekomstige acties eerst om in een leerbare interactie-latent. Die representatie begrenst vervolgens de generatie van toekomstige video. 1
Zo hoeft de videogenerator niet in zijn eentje actiebetekenis, interactievoorspelling én visuele weergave te leren. Hij kan zich sterker richten op consistente beelden en details, terwijl een gespecialiseerde representatielaag de robot-objectinteractie voorspelt.
LJM bestaat uit twee samenwerkende experts:
Een bruikbare vergelijking is die tussen een interactiescenario en de visuele uitwerking ervan. De eerste expert bepaalt wat er vermoedelijk gebeurt; de tweede maakt daar een geloofwaardige visuele toekomst van. Dat biedt een plausibele verklaring voor sterke scores op beweging, ruimtelijke nauwkeurigheid en bestuurbaarheid bij een beperkt aantal GPU’s. Het is echter een architecturale verklaring, geen definitief bewijs van oorzaak en gevolg.
Een latente representatie is niet automatisch fysisch betekenisvol. Daarom koppelt LJM de redeneertokens aan drie voorspeltaken die op waarneembare data aansluiten:
Hierdoor kunnen de latente tokens niet alleen dienen om beelden te maken die er aannemelijk uitzien. Ze moeten ook verband houden met waar de robot naartoe beweegt, welke objecten veranderen en in welke richting de zichtbare beweging verloopt. De openbare beschrijving spreekt van een gecombineerde beperking door toekomstige robottoestanden, optische stroom en visuele latents. 1
Dit garandeert geen foutloos begrip van fysica in alle situaties, bijvoorbeeld bij ingewikkeld contact, wrijving of occlusie. Wel geeft het model directere interactiesignalen dan uitsluitend videoreconstructie.
LJM gebruikt ook shared attention in een Mixture-of-Transformers-opzet. De reasoning tokens en videotokens wisselen daarbij informatie uit tussen de lagen, in plaats van dat een vast conditievector slechts één keer naar de videogenerator wordt gestuurd. 1
Het beoogde effect is voortdurende afstemming in twee richtingen:
Dat verschilt van een eenrichtingsaanpak met statische conditionering. Als positie, zichtbaarheid of beweging van een object tijdens het genereren verandert, hoeft de interactierepresentatie theoretisch niet vast te blijven zitten aan de initiële invoer. De publieke informatie beschrijft dit mechanisme, maar levert geen onafhankelijke ablatieresultaten die de afzonderlijke bijdrage ervan kwantificeren. 1
In de berichtgeving wordt gesproken over 32 Zhenwu 810E-GPU’s voor training, onder meer voor voortraining op DROID en vervolgtraining op RoboTwin. 1 De interessante conclusie is niet dat videowereldmodellen ineens goedkoop zijn, maar dat deze opzet mogelijk minder van de videogenerator vraagt.
De efficiëntieclaim berust dus op een inductieve bias: rekenkracht gaat naar een latente representatie met een duidelijke interactiebetekenis en meetbare fysieke beperkingen. Daardoor hoeft één monolithisch videomodel niet indirect uit pixels tegelijk actiecontrole, ruimtelijke structuur, objectdynamiek en beeldkwaliteit te ontdekken.
Alleen het aantal GPU’s is echter geen betrouwbare maat voor totale trainingskosten. Trainingstijd, datasetomvang, modelgrootte, resolutie, parallelisatie-efficiëntie en trainingsfasen kunnen sterk uiteenlopen. Met de huidige informatie is daarom niet nauwkeurig te berekenen hoeveel totale rekencapaciteit LJM ten opzichte van andere systemen heeft bespaard.
Openbare berichtgeving stelt dat Muka Robotics in april 2026 is opgericht en zich richt op wereldmodellen voor robots in de fysieke wereld. De Hong Kong University of Science and Technology-promovendus Chi Xiaowei wordt daarin genoemd als oprichter; een andere bron noemt hem medeoprichter en CEO. 18
38
Over de volledige herkomst van het team — eerdere werkgevers, labs of instellingen — bieden de aangeleverde bronnen geen voldoende consistente en betrouwbare details. Wat wel op basis van die berichtgeving kan worden gezegd, is dat Chi Xiaowei een doctoraatsachtergrond aan HKUST heeft. Daaruit valt geen bredere teamgeschiedenis af te leiden. 18
38
De prestatie van SisyphusWorld ondersteunt een richting die verder onderzoek verdient: robotische wereldmodellen hoeven niet uitsluitend grotere videogeneratoren te bouwen om realistischer te worden. Ze kunnen ook de gevolgen van interacties expliciet als leerdoel opnemen en die nauw koppelen aan videogeneratie.
De ranglijst bewijst nog niet dat expliciet fysisch redeneren in het algemeen beter werkt dan opschalen, noch dat LJM onder alle robots, datasets of omstandigheden in de echte wereld de beste keuze is. Daarvoor zijn openbare technische rapporten nodig met ablaties van de fysieke supervisie, gedeelde aandacht en de tweedeling in experts — plus evaluaties over datasets, robotlichamen en echte gesloten-regelkringbesturing heen.
De meest zorgvuldige conclusie is daarom: LJM biedt een overtuigende technische hypothese. Door interactiegevolgen en visuele generatie samen maar niet als één ongedifferentieerde taak te trainen, kan een model mogelijk met gerichter rekenwerk zowel de fysieke consistentie als de beeldkwaliteit verbeteren. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Volgens openbare berichtgeving behaalde Muka Robotics’ anonieme inzending SisyphusWorld een EWMScore P van 73,06 op WorldArena, goed voor de tweede plaats achter Xiaomi UNIS met 73,64.
Volgens openbare berichtgeving behaalde Muka Robotics’ anonieme inzending SisyphusWorld een EWMScore P van 73,06 op WorldArena, goed voor de tweede plaats achter Xiaomi UNIS met 73,64. LJM laat een redeneerexpert eerst de gevolgen van robotacties in een latente ruimte voorspellen.
De publieke informatie ondersteunt een interessante architectuurhypothese, maar bevat nog geen onafhankelijke, volledige ablaties waarmee de bijdrage van ieder onderdeel definitief is vast te stellen.