Julkisten raporttien mukaan Muka Roboticsin anonyymisti lähettämä SisyphusWorld saavutti WorldArenan julkisella listalla EWMScore P tuloksen 73,06 ja sijoittui toiseksi. LJM ennakoi ensin toiminnan ja robotti–esine vuorovaikutuksen seurauksia latentissa tilassa, minkä jälkeen erillinen videomalli tuottaa tulevat kuvat.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did four-month-old Muka Robotics’ anonymously submitted SisyphusWorld LJM (Latent Joint-conditional Model) achieve second place globally. Article summary: Muka Robotics’ result appears to come from architectural efficiency: LJM separates predicting the physical consequences of an action from rendering a realistic video, then couples those jobs tightly rather than asking on. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Muka Roboticsin LJM:n (Latent Joint-conditional Model) kiinnostavin piirre ei ole väite siitä, että pieni laskenta päihittäisi aina suuret harjoitusajot. Kiinnostavampaa on tapa jakaa työ: robottitoiminnan fyysisten seurausten ennakointi opetetaan erikseen siitä, miten nämä seuraukset renderöidään uskottavaksi videoksi.
Julkisten raporttien mukaan Mukan nimimerkillä SisyphusWorld jättämä malli sai WorldArenan julkisella listalla EWMScore_P-tuloksen 73,06 ja sijoittui toiseksi, kun Xiaomi UNIS sai 73,64. Raportoituja osatuloksia olivat 89,17 Motion Quality, 92,60 3D Accuracy ja 85,93 Controllability. Harjoituksessa kerrotaan käytetyn 32 Zhenwu 810E -GPU:ta. 1 Tulos on huomionarvoinen, mutta saatavilla oleva aineisto perustuu pääosin alusta- ja mediaraportteihin: se ei korvaa avointa, riippumatonta toistoa tai kattavaa ablaatiotutkimusta.
Tavallisessa toiminnolla ehdollistetussa videodiffuusiomallissa robotin liike tuodaan videomallille usein matalaulotteisena lisäehtona. Se voi tehdä tuotetusta videosta ohjattavamman, mutta samalla saman mallin on opittava pikseli- tai videotason harjoitustavoitteista, mitä toimintalukujen pitäisi fyysisesti tarkoittaa: osuuko robottikäsi esineeseen, tarttuuko se siihen, mihin esine siirtyy ja säilyvätkö tilasuhteet johdonmukaisina.
LJM pyrkii tekemään tämän väliaskeleen näkyväksi. Se muuntaa kieliohjeen, visuaalisen historian, nykyisen ankkurihavainnon ja tulevat toiminnot opittavaksi vuorovaikutuslatentiksi, joka rajoittaa myöhempää tulevaisuusvideon generointia. 1 Näin videomallin ei tarvitse yksin ratkaista toiminnan tulkintaa, vuorovaikutuksen ennustamista ja kuvallista esittämistä.
Ajatus ei vähättele video-osaamisen merkitystä. Päinvastoin: LJM:n lähtökohta on, että generaattori voi käyttää enemmän kapasiteettiaan visuaaliseen jatkuvuuteen ja yksityiskohtiin, kun robotti–esine-vuorovaikutuksen ennustamiseen on oma esityskerroksensa.
LJM koostuu kahdesta yhteistyötä tekevästä asiantuntijasta:
Vertauskuvana ensimmäinen asiantuntija kirjoittaa vuorovaikutuksen käsikirjoituksen, toinen visualisoi sen. Tällainen työnjako voi selittää, miksi ratkaisu voi saavuttaa hyvän liike-, tila- ja ohjattavuustuloksen rajatummilla harjoitusresursseilla. Se on kuitenkin arkkitehtuurista johdettu uskottava selitys, ei vielä lopullinen kausaalinen näyttö.
Pelkkä latentti muuttuja ei takaa, että se kuvaa oikeita fysikaalisia tapahtumia. LJM asettaa päättelytokeneille kolme havaittavaan dataan kytkeytyvää ennustevaatimusta:
Näiden tavoitteiden tarkoitus on estää latentin esityksen jääminen vain uskottavan näköisten ruutujen apuvälineeksi. Sen on myös selitettävä, minne robotti liikkuu, mitkä esineet muuttuvat ja mihin suuntaan liike kuvassa etenee. Julkisissa kuvauksissa tätä luonnehditaan tulevan robotin tilan, optisen virtauksen ja visuaalisten latenttien lomittaiseksi ohjaukseksi. 1
Tämä ei silti takaa tiukkaa fysikaalista ymmärrystä kaikissa kosketus-, kitka- tai peittymistilanteissa. Se tarjoaa kuitenkin pelkkää videon rekonstruointia suorempia signaaleja robottien ja esineiden välisestä vuorovaikutuksesta.
LJM käyttää Mixture-of-Transformers-rakenteessa jaettua attention-mekanismia, jonka kautta päättelytokenit ja videotokenit vaihtavat tietoa mallin eri kerroksissa. 1 Ratkaisu eroaa asetelmasta, jossa videon generaattorille annetaan vain kerran kiinteä ehto-vektori.
Suunniteltu hyöty on jatkuva kaksisuuntainen yhteensovitus:
Tämä voisi olla hyödyllistä pitkissä tapahtumaketjuissa, joissa esineen paikka, peittyminen tai liike muuttuu generoinnin aikana. Julkisissa materiaaleissa mekanismi kuvataan, mutta niissä ei esitetä riippumatonta ablaatiotulosta, jolla juuri jaetun huomion yksittäinen vaikutus voitaisiin mitata. 1
Raporttien mukaan LJM:n harjoituksessa käytettiin 32 Zhenwu 810E -GPU:ta sekä DROID-esiharjoituksessa että RoboTwin-jatkoharjoituksessa. 1 Oleellinen tulkinta ei ole, että videomaailmamallien harjoittamisesta olisi tullut automaattisesti halpaa. Sen sijaan arkkitehtuuri voi vähentää tarvetta pakottaa yksi videomalli löytämään vuorovaikutuksen rakenteet epäsuorasti pikseleistä.
Tehokkuusväite liittyy siis induktiiviseen oletukseen: laskentaa kohdistetaan eksplisiittiseen, vuorovaikutuksen kannalta merkitykselliseen latenttiin esitykseen ja sen havaittaviin rajoitteisiin, eikä yhden videomallin oleteta oppivan samanaikaisesti ohjausta, tilarakennetta, esinedynamiikkaa ja kuvanlaatua.
Pelkkä GPU-määrä ei kuitenkaan riitä vertailemaan kokonaislaskentaa. Harjoitusajan, datamäärän, parametrimäärän, resoluution, rinnakkaistehokkuuden ja harjoitusvaiheiden erot voivat olla suuria. Nykyisten tietojen perusteella ei voi laskea luotettavasti, kuinka paljon kokonaislaskentaa LJM säästi suhteessa muihin malleihin.
Julkisten raporttien mukaan Muka Robotics perustettiin huhtikuussa 2026, ja se keskittyy fyysiseen todellisuuteen tarkoitettuihin robottien maailmanmalleihin. Hongkongin tiede- ja teknologiayliopistosta väitellyt Chi Xiaowei on nimetty perustajaksi; erään raportin mukaan hän on yrityksen laillinen edustaja ja tosiasiallinen määräysvallan käyttäjä, toisen mukaan toinen perustaja ja toimitusjohtaja. 18
38
Koko tiimin aiemmista työnantajista, laboratorioista tai taustaorganisaatioista ei annetuissa lähteissä ole riittävän yhtenäistä ja luotettavaa tietoa. Siksi perustelluin johtopäätös koskee Chin Hongkongin tiede- ja teknologiayliopistotaustaa, ei koko tiimin laajempaa taustaa. 18
38
SisyphusWorldin listatulos tukee tutkimussuuntaa, jota kannattaa testata lisää: robottien maailmanmallien ei välttämättä tarvitse tavoitella parempaa fyysistä uskottavuutta vain kasvattamalla videogeneraattorin kokoa. Vaihtoehtona on opettaa toiminnan seuraukset eksplisiittisesti ja kytkeä ne tiiviisti videon generointiin.
Sijoitus ei yksin todista, että eksplisiittinen fyysinen päättely olisi yleisesti parempi kuin suuremman mittakaavan harjoitus. Se ei myöskään osoita, että LJM olisi ylivoimainen kaikilla roboteilla, kaikissa datajakaumissa tai aidossa suljetun silmukan ohjauksessa. Vahvempi näyttö vaatisi avoimempaa teknistä raportointia: ablaatioita fyysisille ohjaustavoitteille, jaetulle huomiolle ja kahden asiantuntijan työnjaolle sekä arviointeja eri aineistoilla, robottirungoilla ja todellisissa ohjaustilanteissa.
Tällä hetkellä varovainen johtopäätös on, että LJM esittää vakuuttavan insinöörihypoteesin: kun vuorovaikutuksen ennakointi ja visuaalinen generointi opetetaan yhdessä mutta eri tehtävinä, laskenta voidaan ehkä kohdistaa tarkemmin ja samalla parantaa sekä fyysistä johdonmukaisuutta että kuvanlaatua. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Julkisten raporttien mukaan Muka Roboticsin anonyymisti lähettämä SisyphusWorld saavutti WorldArenan julkisella listalla EWMScore P tuloksen 73,06 ja sijoittui toiseksi.
Julkisten raporttien mukaan Muka Roboticsin anonyymisti lähettämä SisyphusWorld saavutti WorldArenan julkisella listalla EWMScore P tuloksen 73,06 ja sijoittui toiseksi. LJM ennakoi ensin toiminnan ja robotti–esine vuorovaikutuksen seurauksia latentissa tilassa, minkä jälkeen erillinen videomalli tuottaa tulevat kuvat.