公開報道指,Muka Robotics 以匿名代號 SisyphusWorld 提交的 LJM,在 WorldArena 公開榜取得 73.06 EWMScore P、位列第二,訓練據稱使用 32 張 Zhenwu 810E GPU。[1] LJM 先喺潛在空間推演動作造成的互動,再生成未來影片;它結合 Qwen3 VL 2B 推理專家與 Wan2.2 TI2V 5B 影片專家,並以末端執行器位置、物件視覺動態及光流方向作約束。[1] 呢個成績支持「明確學習互動後果」的技術方向,但現有公開資料未足以獨立證明每個模組的增益,亦未能證實它在所有機械人與真實部署情境都更優勝。
研究答案

Create a landscape editorial hero image for this Studio Global article: How did four-month-old Muka Robotics’ anonymously submitted SisyphusWorld LJM (Latent Joint-conditional Model) achieve second place globally. Article summary: Muka Robotics’ result appears to come from architectural efficiency: LJM separates predicting the physical consequences of an action from rendering a realistic video, then couples those jobs tightly rather than asking on. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
公開報道指,Muka Robotics 的 LJM(Latent Joint-conditional Model)以匿名代號 SisyphusWorld 參加 WorldArena,EWMScore_P 為 73.06、公開榜排第二,僅次於小米 UNIS 的 73.64;分項則包括 89.17 Motion Quality、92.60 3D Accuracy、85.93 Controllability。報道稱,模型訓練使用 32 張 Zhenwu 810E GPU。1
重點唔係「32 張 GPU 一定可以打贏更多 GPU」,而係 LJM 用另一種分工方式:將「機械人一郁,現實世界會有咩後果」同「將結果生成為連貫影片」分開學,再令兩部分持續交換資訊。咁做理論上可以減少單一影片模型要由像素層面自己摸索接觸、抓取、移動同空間關係的負擔。
同時要留意:現時可見證據主要來自平台及媒體報道,未等同有完整公開、獨立覆現的實驗報告或消融研究。
一般動作條件影片擴散模型,通常會將機械人動作當成一組低維數值,加入影片生成網絡作條件。模型雖然可以跟住動作出片,但仍要靠影片或像素層面的訓練目標,自行推斷數值背後的物理意思:機械臂有冇碰到物件、夾爪有冇夾實、物件會點移動,以及場景的前後空間關係有冇維持一致。
LJM 想將呢一步講清楚、學明確。它先把語言指令、過去視覺畫面、目前錨點觀測與未來動作,轉成可學習的「互動潛變量」,再用呢個表示去約束未來影片生成。1
簡單講,好似先寫好一份「互動劇本」——手臂去邊、物件可能點郁——再交畀生成器負責將劇本渲染成畫面。影片生成仍然重要,只係唔使獨自兼任理解動作、預測交互同製作視覺效果全部工作。
LJM 由兩個協作專家組成:
呢種設計的合理之處,在於將「預測物理後果」同「畫得似真」分工處理:前者集中處理動作與物件之間的關係,後者集中維持影像細節與視覺一致性。這可以解釋為何它可能在相對集中的訓練資源下取得不錯的運動、空間與可控性表現;不過,這只是架構上的解釋,未構成因果效果的最終證明。
單靠加一組潛變量,唔代表模型真係理解物理。LJM 再對每個推理 token 加上三類可觀測、可對應訓練資料的預測約束:
即係話,潛在表示唔可以只幫手生成「好似幾真」的畫面,仲要交代手臂去咗邊、邊件物件有變,以及畫面中的移動方向。報道形容這是把未來本體狀態、光流與視覺潛變量交錯監督。1
當然,這些約束唔保證模型在所有摩擦、遮擋、碰撞或複雜接觸情境都具備嚴格物理理解;但相比純粹重建影片,它提供了更直接的互動學習訊號。
LJM 採用 Mixture-of-Transformers 形式的共享注意力,令推理 token 同影片 token 可以在模型不同層之間交換資訊,而唔係只係一開始將固定條件向量丟入影片生成器。1
設計目的係形成持續協調:
相比單向、一次性的條件注入,呢種逐層交換理論上較適合處理長過程中的變化。例如物件位置、遮擋情況或運動狀態一路改變時,互動表示未必只停留在最初那份靜態條件。公開資料有描述這個機制,但未提供足以量化其單獨貢獻的獨立消融結果。1
報道稱,LJM 在 DROID 預訓練及 RoboTwin 持續訓練中使用 32 張 Zhenwu 810E GPU。1 值得睇的唔係「世界模型從此平價」,而係這個架構有可能減少影片生成器由像素間接發現互動結構的工作量。
換句話講,它的效率主張來自一種歸納偏置:把較多學習重點放在有清晰互動含義的潛在表示及可觀測約束,而唔係要求一個單體影片模型同時學懂動作控制、空間結構、物件動態同畫面品質。
不過,GPU 數量本身唔可以直接當成總訓練算力的比較。訓練時長、資料規模、參數量、影像解像度、平行化效率與不同訓練階段都會影響總成本。因此,根據目前資料,未能嚴格計算 LJM 比其他系統實際慳咗幾多計算資源。
公開報道顯示,Muka Robotics 於 2026 年 4 月成立,聚焦面向真實物理世界的機械人世界模型;報道列香港科技大學博士 池曉威為創始人,並稱他是公司法定代表人及實際控制人。38 另有報道稱他為聯合創始人兼 CEO。
18
至於完整團隊曾任職哪些公司、來自哪些實驗室或機構,所提供資料未有足夠可靠而一致的細節。因此,較穩妥的說法是:池曉威的港科大博士背景有公開報道支持,但不能由此推斷整個團隊的詳細履歷。18
38
SisyphusWorld 的榜單成績,支持一個值得繼續驗證的方向:機械人世界模型未必只可以不斷放大影片生成器,亦可以將「互動會造成咩後果」當成明確的學習目標,再同影片生成緊密結合。
但單靠榜單排名,未能證明「顯式物理推理」已普遍勝過大規模訓練,更唔代表 LJM 在所有機械人本體、資料分布或真實閉環控制場景都會佔優。要驗證這件事,仍需要完整技術報告,包括不同物理監督項、共享注意力、雙專家分工的消融實驗,以及跨資料集、跨機械人平台與真實世界閉環控制的評測。
目前較合理的結論係:LJM 提出了一個有說服力的工程假設——將互動推演與視覺生成聯合訓練、但不混為一談,可能讓模型以較集中的計算投入,同時改善物理一致性與視覺品質。 1
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
公開報道指,Muka Robotics 以匿名代號 SisyphusWorld 提交的 LJM,在 WorldArena 公開榜取得 73.06 EWMScore P、位列第二,訓練據稱使用 32 張 Zhenwu 810E GPU。[1]
公開報道指,Muka Robotics 以匿名代號 SisyphusWorld 提交的 LJM,在 WorldArena 公開榜取得 73.06 EWMScore P、位列第二,訓練據稱使用 32 張 Zhenwu 810E GPU。[1] LJM 先喺潛在空間推演動作造成的互動,再生成未來影片;它結合 Qwen3 VL 2B 推理專家與 Wan2.2 TI2V 5B 影片專家,並以末端執行器位置、物件視覺動態及光流方向作約束。[1]
呢個成績支持「明確學習互動後果」的技術方向,但現有公開資料未足以獨立證明每個模組的增益,亦未能證實它在所有機械人與真實部署情境都更優勝。