공개 보도에 따르면 Muka Robotics의 익명 출품 모델 SisyphusWorld는 WorldArena에서 EWMScore P 73.06으로 2위에 올랐다. LJM은 행동의 물리적 결과를 잠재공간에서 먼저 추론한 뒤 미래 영상을 생성한다.
연구 답변

Create a landscape editorial hero image for this Studio Global article: How did four-month-old Muka Robotics’ anonymously submitted SisyphusWorld LJM (Latent Joint-conditional Model) achieve second place globally. Article summary: Muka Robotics’ result appears to come from architectural efficiency: LJM separates predicting the physical consequences of an action from rendering a realistic video, then couples those jobs tightly rather than asking on. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Muka Robotics의 LJM(Latent Joint-conditional Model)이 주목받는 이유는 작은 연산 자원이 언제나 큰 학습 규모를 이긴다는 것을 증명해서가 아니다. 로봇의 행동이 물리 세계에 어떤 결과를 낳는지 예측하는 일과, 그 결과를 자연스러운 미래 영상으로 만들어내는 일을 분리해 학습한 뒤 긴밀히 협업시킨 구조를 제시했다는 데 있다.
공개 보도에 따르면 Muka는 SisyphusWorld라는 익명 이름으로 LJM을 WorldArena에 제출했다. EWMScore_P는 73.06으로 공개 리더보드 2위였고, 1위인 샤오미 UNIS의 73.64에 뒤를 이었다. 보도된 세부 지표는 Motion Quality 89.17, 3D Accuracy 92.60, Controllability 85.93이며, 학습에는 Zhenwu 810E GPU 32장이 사용됐다.1 다만 이는 현재 플랫폼 및 언론 보도를 통해 알려진 결과로, 공개된 독립 재현이나 완전한 절제 실험을 대체하지는 않는다.
기존의 행동 조건부 영상 확산 모델은 대체로 로봇 행동을 저차원 조건으로 영상 생성 네트워크에 넣는다. 그러면 행동에 따른 영상 변화를 유도할 수는 있지만, 모델은 픽셀·영상 중심의 학습 목표만으로 숫자로 된 행동의 의미를 스스로 추론해야 한다. 예를 들어 로봇팔이 물체에 접촉했는지, 그리퍼가 물체를 잡았는지, 물체가 어디로 이동할지, 공간 관계가 계속 유지될지를 모두 영상 생성 과정 안에서 함께 배워야 한다.
LJM은 이 부담을 명시적으로 나눈다. 언어 지시, 과거 시각 정보, 현재 앵커 관측, 미래 행동을 학습 가능한 상호작용 잠재표현으로 바꾸고, 그 표현으로 이후 미래 영상 생성을 제약한다.1 즉 영상 생성기가 행동 해석, 상호작용 예측, 장면 표현을 혼자 모두 떠안는 방식이 아니다.
LJM은 서로 협력하는 두 전문가로 구성된다.
비유하면 첫 번째 전문가는 ‘행동 뒤에 무엇이 일어날지’에 관한 상호작용 시나리오를 만들고, 두 번째 전문가는 이를 설득력 있는 영상으로 렌더링한다. 이 분업은 제한된 학습 자원에서도 운동·공간·제어 일관성을 높일 수 있다는 설명이 될 수 있다. 다만 이것은 구조적으로 타당한 해석이지, 해당 설계가 성능 향상의 원인임을 최종적으로 입증한 것은 아니다.
잠재변수를 도입한다고 해서 그것이 실제 물리 과정을 자동으로 담아내는 것은 아니다. LJM은 잠재 추론 토큰에 관측 가능한 데이터와 연결된 세 종류의 예측 제약을 둔다.
이 제약의 요지는 잠재표현이 그럴듯한 프레임을 생성하는 데만 쓰여서는 안 된다는 것이다. 로봇이 어디로 가는지, 어떤 물체가 바뀌는지, 화면 속 움직임이 어느 방향으로 진행되는지를 함께 설명해야 한다. 공개 자료는 이를 미래 로봇 상태, 광류, 시각 잠재변수에 대한 교차 감독으로 설명한다.1
물론 이런 목표가 모든 접촉·마찰·가림 상황에서 엄밀한 물리 이해를 보장하는 것은 아니다. 그러나 단순 영상 재구성보다 직접적인 상호작용 신호를 학습에 제공한다는 점은 분명하다.
LJM은 Mixture-of-Transformers 형태의 공유 어텐션(shared attention) 을 사용한다. 추론 토큰과 영상 토큰이 모델 층을 거치며 정보를 교환하도록 하는 방식이다. 고정된 조건 벡터를 영상 생성기에 한 번 전달하는 구조와는 다르다.1
설계 의도는 지속적인 양방향 조율에 있다.
물체 위치나 가림, 운동 상태가 생성 과정에서 달라지는 긴 시퀀스에서는 처음의 정적 조건만 유지하는 것보다 적합할 수 있다. 다만 공개 자료에는 이 공유 어텐션의 단독 효과를 수치로 분리해 보여 주는 독립 절제 실험은 제시되지 않았다.1
보도는 LJM이 DROID 사전학습과 RoboTwin 추가 학습에 Zhenwu 810E GPU 32장을 활용했다고 전한다.1 여기서 중요한 해석은 ‘영상 세계모델이 저렴해졌다’는 선언이 아니다. 생성기가 픽셀에서 상호작용 구조를 간접적으로 발견해야 하는 부담을 줄이는 설계일 수 있다는 점이다.
효율성 주장의 바탕은 귀납 편향이다. 행동과 상호작용의 의미가 분명한 잠재표현, 그리고 관측 가능한 물리 제약에 학습 자원을 배분함으로써, 단일 영상 모델이 제어·공간 구조·물체 동역학·화질을 동시에 알아내도록 하는 부담을 덜겠다는 접근이다.
다만 GPU 장수만으로 총학습 연산량을 직접 비교할 수는 없다. 학습 시간, 데이터 규모, 모델 파라미터 수, 해상도, 병렬화 효율, 학습 단계가 시스템마다 다를 수 있기 때문이다. 현재 정보만으로 LJM이 다른 모델보다 총연산량을 얼마나 절감했는지를 엄밀하게 산출하기는 어렵다.
공개 보도에 따르면 Muka Robotics는 2026년 4월 설립됐으며, 실제 물리 세계를 위한 로봇 세계모델에 집중하고 있다. 홍콩과학기술대 박사인 츠샤오웨이(池晓威) 가 창업자로 언급됐고, 법정대표자 및 실질 지배자로 등록됐다는 보도도 있다.38 다른 보도에서는 그를 공동창업자 겸 CEO로 소개한다.
18
반면 전체 팀이 어느 기업·연구실·기관 출신인지에 대해서는 제공된 자료만으로 신뢰도 높고 일관된 세부 정보를 확인하기 어렵다. 따라서 츠샤오웨이의 홍콩과기대 박사 배경은 보도로 뒷받침되지만, 이를 바탕으로 전체 팀의 이력까지 확대 해석해서는 안 된다.18
38
SisyphusWorld의 리더보드 결과는 로봇 세계모델이 영상 생성기의 규모를 키우는 것만으로 사실성을 추구할 필요는 없다는 가설에 힘을 싣는다. 행동이 낳을 상호작용 결과를 명시적인 학습 대상으로 삼고, 이를 영상 생성과 촘촘히 결합하는 길도 가능하다는 것이다.
그러나 리더보드 순위만으로 ‘명시적 물리 추론’이 규모 확장보다 일반적으로 우수하다고 결론 내릴 수는 없다. 모든 로봇 본체, 데이터 분포, 실제 배치 환경에서 LJM이 유리하다는 증거도 아니다. 이를 검증하려면 물리 감독 항목별 효과, 공유 어텐션, 두 전문가 분업에 대한 절제 실험과 함께, 데이터셋·로봇 본체를 넘나드는 평가 및 실제 폐루프 제어 평가가 더 공개돼야 한다.
현시점에서 가장 신중한 결론은 다음과 같다. 상호작용 결과를 추론하는 과정과 시각적 생성을 결합하되 혼동하지 않도록 학습하면, 더 집중된 연산 투자로 물리적 일관성과 영상 품질을 함께 개선할 가능성이 있다. 1
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
공개 보도에 따르면 Muka Robotics의 익명 출품 모델 SisyphusWorld는 WorldArena에서 EWMScore P 73.06으로 2위에 올랐다.
공개 보도에 따르면 Muka Robotics의 익명 출품 모델 SisyphusWorld는 WorldArena에서 EWMScore P 73.06으로 2위에 올랐다. LJM은 행동의 물리적 결과를 잠재공간에서 먼저 추론한 뒤 미래 영상을 생성한다. Qwen3 VL 2B 기반 추론 전문가와 Wan2.2 TI2V 5B 기반 세계모델 전문가를 결합하고, 말단장치 위치·물체 변화·광류 방향으로 잠재 표현을 제약한다.[1]
다만 현재 공개된 근거는 플랫폼·언론 보도 중심이다. 각 구성 요소의 기여도, 대규모 모델 대비 총연산량 절감 폭, 실제 폐루프 로봇 제어에서의 범용성은 독립 재현과 체계적 절제 실험으로 추가 검증돼야 한다.[1]