За відкритими повідомленнями, анонімна модель SisyphusWorld від Muka Robotics набрала 73,06 EWMScore P і посіла друге місце у WorldArena після Xiaomi UNIS (73,64). Ключова ідея LJM — спершу змоделювати в латентному просторі наслідки дії робота для взаємодії з об’єктами, а вже потім генерувати майбутнє відео.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did four-month-old Muka Robotics’ anonymously submitted SisyphusWorld LJM (Latent Joint-conditional Model) achieve second place globally. Article summary: Muka Robotics’ result appears to come from architectural efficiency: LJM separates predicting the physical consequences of an action from rendering a realistic video, then couples those jobs tightly rather than asking on. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Заявлений результат Muka Robotics привертає увагу не тим, що невеликий обсяг обчислень нібито завжди перемагає масштабне навчання. Радше він демонструє інший розподіл роботи моделі: окремо передбачати, до чого призведе дія робота у фізичному середовищі, й окремо перетворювати цей прогноз на послідовне відео.
За відкритими повідомленнями, Muka подала LJM під анонімним псевдонімом SisyphusWorld. Модель отримала 73,06 EWMScore_P і друге місце у публічному рейтингу WorldArena, поступившись Xiaomi UNIS із результатом 73,64. Також наводяться оцінки 89,17 за якість руху, 92,60 за 3D-точність і 85,93 за керованість; для навчання, за повідомленнями, застосували 32 GPU Zhenwu 810E.1
Ці цифри варті уваги, але наявні докази походять переважно з описів платформи та медіа. Вони не замінюють повного незалежного відтворення результатів і відкритих абляційних досліджень.
У типових моделях відеодифузії, керованих діями, рухи робота подаються як низьковимірна умова для генератора відео. Відео змінюється відповідно до команди, але сам генератор усе одно має вивести з піксельних або відеовтрат, що означають числові дії: чи торкнувся маніпулятор предмета, чи захопив його захват, куди той переміститься та чи збережуться просторові зв’язки.
LJM робить цей проміжний крок явним. Вона перетворює мовну інструкцію, історію візуальних спостережень, поточне опорне спостереження і майбутні дії на навчуване латентне представлення взаємодії, яке обмежує подальшу генерацію майбутнього відео.1
Отже, відеогенератор не мусить самотужки одночасно інтерпретувати дію, прогнозувати контакт і рух об’єктів та створювати правдоподібне зображення. Це не зменшує ролі генерації відео: ідея полягає в тому, щоб більше її ресурсу спрямувати на візуальну узгодженість і деталі.
LJM об’єднує двох експертів, які працюють спільно:
Практично це схоже на поєднання «сценарію взаємодії» та «візуального рендерингу». Такий поділ може пояснювати сильні результати за рухом, простором і керованістю за обмежених ресурсів. Проте це правдоподібне пояснення на рівні архітектури, а не остаточний доказ причинного ефекту.
Самого латентного представлення недостатньо, щоб гарантувати реалістичне відображення фізики. Тому LJM, за описом, накладає на токени міркування три типи прогнозних обмежень, пов’язаних зі спостережуваними даними:
Сенс цих цілей у тому, що латентне представлення має не просто допомагати генерувати переконливі кадри. Воно також повинно пояснювати, куди рухається робот, які предмети змінюються і в якому напрямку відбувається рух у сцені. У відкритому описі це подано як спільне обмеження майбутнього стану робота, оптичного потоку й візуальних латентних змінних.1
Це не означає, що модель гарантовано має суворе фізичне розуміння в усіх випадках контакту, тертя чи перекриття об’єктів. Але такі обмеження дають навчальному процесу пряміші сигнали про взаємодію, ніж лише відтворення відео.
У LJM застосовано shared attention, або спільну увагу, у формі Mixture-of-Transformers. Токени міркування і відеотокени обмінюються інформацією між шарами моделі, а не працюють за схемою, де один незмінний вектор умов один раз передається генератору відео.1
Мета такого рішення — постійна двостороння координація:
Порівняно з односпрямованим введенням умови, обмін на рівні шарів теоретично краще відповідає довшим процесам: наприклад, коли під час генерації змінюються положення предмета, перекриття або його стан руху. Водночас у доступних матеріалах немає незалежних абляцій, які кількісно ізолювали б внесок саме цього механізму.1
Повідомлення описують навчання LJM на 32 GPU Zhenwu 810E, з попереднім навчанням на DROID і подальшим донавчанням на RoboTwin.1 Важливий висновок тут не в тому, що моделі відеосвіту стали «дешевими». Імовірніше, архітектура зменшує навантаження на відеогенератор: йому не потрібно непрямо виявляти всю структуру взаємодій лише з пікселів.
Тобто заявлена ефективність спирається на індуктивне упередження: обчислення спрямовуються на латентне представлення з чітким значенням для взаємодії та на його перевірювані обмеження, а не на спробу навчити єдину відеомодель водночас контролю, просторовій структурі, динаміці об’єктів і якості кадру.
Втім, кількість GPU сама собою не дає змоги коректно порівняти загальні витрати на навчання. Різні системи можуть відрізнятися тривалістю тренування, обсягом даних, кількістю параметрів, роздільною здатністю, ефективністю паралелізації та кількістю етапів навчання. Тому наявних відомостей замало, щоб строго підрахувати, скільки сукупних обчислень LJM заощадила порівняно з іншими моделями.
За повідомленнями, Muka Robotics заснована у квітні 2026 року й зосереджена на робототехнічних моделях світу для реального фізичного середовища. Засновником називають Чі Сяовея — доктора Гонконзького університету науки і технологій; в одному з матеріалів він вказаний як законний представник і фактичний контролер компанії.38 Інше джерело називає його співзасновником і CEO.
18
Надійних і узгоджених відомостей про повний склад команди, її попередні компанії чи лабораторії в наданих матеріалах немає. Тому коректно говорити про публічно згаданий докторський статус Чі Сяовея в HKUST, але не екстраполювати це на всю команду.18
38
Позиція SisyphusWorld у рейтингу підтримує напрям, який ще варто ретельно перевіряти: робототехнічній моделі світу не обов’язково покладатися лише на масштабування відеогенератора. Альтернативою може бути явне навчання наслідків взаємодії та його тісне поєднання з генерацією відео.
Однак місце в рейтингу саме по собі не доводить, що явне фізичне міркування вже загалом краще за масштабне навчання. Воно також не доводить переваги LJM для всіх роботів, наборів даних або умов реального розгортання. Для цього потрібні повніші технічні звіти: абляції фізичних обмежень, спільної уваги та поділу на двох експертів, а також випробування на різних наборах даних, роботизованих платформах і в реальному замкненому контурі керування.
Наразі найобережніший висновок такий: LJM пропонує переконливу інженерну гіпотезу — якщо навчати прогнозування взаємодії та візуальну генерацію разом, але не змішувати їх в одну нерозділену задачу, можна потенційно точніше витрачати обчислювальні ресурси та водночас покращувати фізичну й візуальну узгодженість. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
За відкритими повідомленнями, анонімна модель SisyphusWorld від Muka Robotics набрала 73,06 EWMScore P і посіла друге місце у WorldArena після Xiaomi UNIS (73,64).
За відкритими повідомленнями, анонімна модель SisyphusWorld від Muka Robotics набрала 73,06 EWMScore P і посіла друге місце у WorldArena після Xiaomi UNIS (73,64). Ключова ідея LJM — спершу змоделювати в латентному просторі наслідки дії робота для взаємодії з об’єктами, а вже потім генерувати майбутнє відео.