Laporan awam menyatakan model Muka Robotics yang dihantar secara anonim sebagai SisyphusWorld memperoleh EWMScore P 73.06 dan menduduki tempat kedua di WorldArena, dengan latihan dilaporkan menggunakan 32 GPU Zhenwu 8... LJM menggabungkan pakar penaakulan berasaskan Qwen3 VL 2B dengan pakar video Wan2.2 TI2V 5B.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did four-month-old Muka Robotics’ anonymously submitted SisyphusWorld LJM (Latent Joint-conditional Model) achieve second place globally. Article summary: Muka Robotics’ result appears to come from architectural efficiency: LJM separates predicting the physical consequences of an action from rendering a realistic video, then couples those jobs tightly rather than asking on. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
LJM (Latent Joint-conditional Model) daripada Muka Robotics menarik perhatian bukan kerana ia membuktikan bahawa kuasa pengkomputeran kecil sentiasa boleh mengatasi latihan besar-besaran. Sebaliknya, ia mencadangkan cara lain membahagikan sumber: ramalkan dahulu kesan tindakan robot terhadap dunia fizikal, kemudian hasilkan video yang menggambarkan kesan tersebut secara konsisten.
Menurut laporan awam, Muka menghantar LJM ke WorldArena menggunakan nama samaran SisyphusWorld. Model itu mencatatkan EWMScore_P 73.06 untuk tempat kedua dalam papan pendahulu terbuka, di belakang Xiaomi UNIS yang mencatat 73.64. Laporan sama menyenaraikan 89.17 bagi Kualiti Pergerakan, 92.60 bagi Ketepatan 3D dan 85.93 bagi Kebolehkawalan, serta menyatakan latihan menggunakan 32 GPU Zhenwu 810E.1 Keputusan ini penting untuk diperhatikan, tetapi bukti yang tersedia setakat ini datang terutamanya daripada laporan platform dan media, bukannya eksperimen replikasi bebas atau kajian ablasi lengkap yang diterbitkan terbuka.
Dalam model resapan video yang dikondisikan oleh tindakan, arahan robot lazimnya dimasukkan sebagai isyarat berdimensi rendah ke dalam rangkaian penjana video. Output boleh berubah mengikut tindakan, tetapi model video itu masih perlu meneka sendiri, melalui objektif latihan berasaskan video atau piksel, maksud fizikal nombor tindakan tersebut: adakah lengan menyentuh objek, adakah pengapit berjaya menggenggamnya, ke arah mana objek bergerak, dan sama ada hubungan ruang kekal konsisten.
LJM cuba menjadikan langkah ini lebih jelas. Arahan bahasa, sejarah visual, pemerhatian sauh semasa dan tindakan masa hadapan mula-mula ditukar kepada laten interaksi yang boleh dipelajari. Laten ini kemudiannya mengehadkan penjanaan video masa hadapan.1
Maksudnya, penjana video tidak lagi memikul semua tugas serentak—memahami tindakan, meramal interaksi dan menghasilkan visual. Ia boleh menumpukan lebih banyak keupayaan kepada kesinambungan visual serta perincian imej, sementara satu lapisan khusus menganggar hubungan robot dengan objek dan persekitaran.
LJM menggunakan dua pakar yang bekerjasama:
Analogi mudahnya ialah gabungan antara “skrip interaksi” dan “pasukan penerbitan visual”. Yang pertama menentukan akibat tindakan; yang kedua memaparkannya sebagai masa depan visual yang munasabah. Pembahagian kerja ini menerangkan mengapa seni bina tersebut mungkin mencapai prestasi baik untuk gerakan, ruang dan kebolehkawalan dengan sumber latihan yang lebih tertumpu—tetapi ia masih penjelasan reka bentuk, bukan bukti muktamad tentang hubungan sebab-akibat.
Memperkenalkan pemboleh ubah laten sahaja tidak menjamin bahawa ia benar-benar membawa makna fizikal. LJM turut mengenakan tiga kekangan ramalan yang sepadan dengan data boleh diperhati pada token penaakulan:
Nilainya ialah perwakilan laten tidak boleh sekadar membantu menghasilkan bingkai yang nampak meyakinkan. Ia dilatih untuk menerangkan ke mana robot bergerak, objek mana berubah, dan arah gerakan dalam visual. Laporan itu menerangkan pendekatan ini sebagai kekangan berselang antara keadaan masa depan robot, aliran optik dan laten visual.1
Ini tidak bermakna model tersebut semestinya memahami semua keadaan sentuhan, geseran atau lindungan pandangan dengan ketepatan fizik yang ketat. Namun, ia memberi isyarat latihan yang lebih langsung tentang interaksi berbanding pembinaan semula video semata-mata.
LJM menggunakan perhatian dikongsi dalam bentuk Mixture-of-Transformers. Token penaakulan dan token video bertukar maklumat merentasi lapisan model, bukan hanya menghantar satu vektor syarat tetap kepada penjana video pada awal proses.1
Tujuannya ialah penyelarasan dua hala yang berterusan:
Berbanding suntikan syarat yang statik dan sehala, pertukaran lapisan demi lapisan lebih sesuai untuk proses panjang yang melibatkan maklum balas. Contohnya, apabila kedudukan objek, lindungan atau keadaan pergerakan berubah sepanjang penjanaan, perwakilan interaksi secara teori tidak perlu kekal terikat pada syarat awal. Bahan awam menerangkan mekanisme ini, tetapi belum menyediakan hasil ablasi bebas yang boleh mengukur sumbangan khususnya.1
Laporan menyatakan LJM dilatih menggunakan 32 GPU Zhenwu 810E, termasuk untuk pralatihan DROID dan latihan sambungan RoboTwin.1 Perkara yang lebih penting bukanlah dakwaan bahawa model dunia video kini murah, tetapi kemungkinan seni bina ini mengurangkan beban penjana video untuk menemui struktur interaksi hanya secara tidak langsung daripada piksel.
Dengan kata lain, hujah kecekapan datang daripada bias induktif: kuasa pengkomputeran diarahkan kepada perwakilan laten yang mempunyai makna interaksi jelas serta kekangan yang boleh diperhati, dan bukannya mengharapkan satu model video tunggal mempelajari kawalan tindakan, struktur ruang, dinamik objek dan kualiti visual secara serentak.
Namun, bilangan GPU sahaja tidak cukup untuk membandingkan jumlah pengkomputeran latihan. Tempoh latihan, saiz data, bilangan parameter, resolusi, kecekapan pemprosesan selari dan peringkat latihan boleh berbeza dengan ketara antara sistem. Maklumat sedia ada tidak mencukupi untuk mengira dengan ketat berapa banyak jumlah pengkomputeran yang dijimatkan LJM berbanding model lain.
Laporan awam menyebut Muka Robotics ditubuhkan pada April 2026 dengan tumpuan terhadap model dunia robotik untuk dunia fizikal sebenar. Chi Xiaowei, pemegang PhD dari Universiti Sains dan Teknologi Hong Kong (HKUST), dilaporkan sebagai pengasas; satu laporan menyatakan beliau ialah wakil sah dan pengawal sebenar syarikat, manakala laporan lain menyifatkannya sebagai pengasas bersama dan CEO.18
38
Namun, bahan yang diberikan tidak menawarkan butiran yang cukup kukuh dan konsisten untuk mengesahkan asal-usul lengkap setiap anggota pasukan—sama ada daripada syarikat, makmal atau institusi tertentu. Kesimpulan yang lebih berhati-hati ialah latar belakang PhD Chi di HKUST dilaporkan secara terbuka, tetapi sejarah keseluruhan pasukan tidak patut andaikan daripada maklumat tersebut.18
38
Prestasi SisyphusWorld pada papan pendahulu menyokong satu arah yang wajar diuji lebih lanjut: model dunia robotik tidak semestinya perlu hanya membesarkan penjana video untuk mengejar realisme. Sebaliknya, kesan interaksi boleh dijadikan objek pembelajaran yang eksplisit dan digandingkan rapat dengan penjanaan video.
Tetapi kedudukan dalam papan pendahulu sahaja tidak membuktikan bahawa “penaakulan fizikal eksplisit” sudah secara umum lebih baik daripada penskalaan latihan, atau bahawa LJM akan unggul untuk semua robot, taburan data dan keadaan pelaksanaan dunia sebenar. Pengesahan yang lebih kukuh masih memerlukan laporan teknikal terbuka, termasuk ablasi bagi setiap kekangan fizikal, perhatian dikongsi dan pembahagian dua pakar, di samping penilaian merentas set data, jenis robot dan kawalan gelung tertutup sebenar.
Buat masa ini, rumusan paling munasabah ialah LJM menawarkan hipotesis kejuruteraan yang meyakinkan: apabila ramalan interaksi dan penjanaan visual dilatih bersama tetapi tidak dicampurkan menjadi satu tugas, model mungkin dapat menggunakan pengkomputeran dengan lebih tertumpu sambil meningkatkan konsistensi fizikal dan mutu visual. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Laporan awam menyatakan model Muka Robotics yang dihantar secara anonim sebagai SisyphusWorld memperoleh EWMScore P 73.06 dan menduduki tempat kedua di WorldArena, dengan latihan dilaporkan menggunakan 32 GPU Zhenwu 8...
Laporan awam menyatakan model Muka Robotics yang dihantar secara anonim sebagai SisyphusWorld memperoleh EWMScore P 73.06 dan menduduki tempat kedua di WorldArena, dengan latihan dilaporkan menggunakan 32 GPU Zhenwu 8... LJM menggabungkan pakar penaakulan berasaskan Qwen3 VL 2B dengan pakar video Wan2.2 TI2V 5B.