לפי דיווחים פומביים, SisyphusWorld — ההגשה האנונימית של Muka Robotics — השיגה ציון EWMScore P של 73.06 ודורגה שנייה ב WorldArena, אחרי UNIS של שיאומי עם 73.64. הרעיון המרכזי של LJM הוא לחזות תחילה במרחב חבוי את תוצאות האינטראקציה של פעולת הרובוט, ורק לאחר מכן להנחות באמצעותן את יצירת הווידאו.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did four-month-old Muka Robotics’ anonymously submitted SisyphusWorld LJM (Latent Joint-conditional Model) achieve second place globally. Article summary: Muka Robotics’ result appears to come from architectural efficiency: LJM separates predicting the physical consequences of an action from rendering a realistic video, then couples those jobs tightly rather than asking on. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
הסיבה ש-LJM (Latent Joint-conditional Model) של Muka Robotics מעוררת עניין אינה הוכחה שלפיה מעט כוח מחשוב תמיד מנצח אימון בקנה מידה גדול. הטענה המעניינת יותר היא חלוקה אחרת של העבודה: להפריד בין השאלה מה פעולת הרובוט תעשה לעולם הפיזי לבין השאלה איך להציג את התוצאה בווידאו עקבי, ואז לאפשר לשני התהליכים לעבוד יחד.
לפי דיווחים פומביים, Muka הגישה את LJM תחת הכינוי האנונימי SisyphusWorld. המודל קיבל 73.06 במדד EWMScore_P ודורג שני בלוח הציבורי של WorldArena, אחרי UNIS של שיאומי עם 73.64. באותם דיווחים הופיעו גם ציוני משנה של 89.17 באיכות תנועה, 92.60 בדיוק תלת־ממדי ו-85.93 בשליטה, וכן הטענה שהאימון נעשה על 32 מעבדי GPU מדגם Zhenwu 810E. 1 אלו תוצאות בולטות, אך הראיות הזמינות נשענות בעיקר על פרסומי פלטפורמה ותקשורת; הן אינן תחליף לשכפול מלא ובלתי תלוי או לניסויי אבלציה פומביים.
במודלים נפוצים של יצירת וידאו מותנית־פעולה, פעולת הרובוט מוזנת כרצף מספרים בעל ממד נמוך למודל הווידאו. הפלט יכול להשתנות בהתאם לפעולה, אבל המודל עדיין נדרש להסיק בעיקר מתוך יעדי אימון חזותיים מה משמעות המספרים: האם הזרוע נגעה בחפץ, האם האחיזה הצליחה, לאן החפץ ינוע, והאם היחסים המרחביים נשמרים.
LJM מנסה להפוך את שלב ההסקה הזה למפורש. היא ממירה הוראה לשונית, היסטוריית תצפיות חזותיות, תצפית עוגן נוכחית ופעולות עתידיות לייצוג חבוי של אינטראקציה. ייצוג זה מגביל ומנחה את יצירת הווידאו העתידי. 1 לכן, מחולל הווידאו אינו צריך לשאת לבדו בנטל של פירוש הפעולה, חיזוי האינטראקציה והפקת התמונה.
אין פירוש הדבר שהווידאו משני בחשיבותו. הרעיון הוא לפנות יותר מיכולת המחולל לעקביות חזותית ולפרטים, בזמן ששכבת ייצוג ייעודית אחראית לחיזוי יחסי רובוט–אובייקט.
ל-LJM שני רכיבים משתפי פעולה:
אפשר לחשוב על השילוב הזה כתסריט של אינטראקציה לצד צוות רינדור: הראשון מתאר את תוצאות הפעולה, והשני הופך אותן לעתיד חזותי אמין. זו סיבה סבירה לכך שהגישה עשויה להשיג תוצאות טובות בתנועה, במרחב ובשליטה גם תחת תקציב אימון מוגבל יותר — אך זו פרשנות ארכיטקטונית, לא הוכחה סיבתית סופית.
עצם קיומו של משתנה חבוי אינו מבטיח שהוא מבטא תהליך פיזי. לכן LJM מטילה על אסימוני ההסקה החבויים שלושה יעדי חיזוי הקשורים לנתונים נצפים:
המשמעות היא שהייצוג החבוי אינו אמור רק לשרת פריימים שנראים משכנעים. הוא צריך להסביר לאן הרובוט מתקדם, אילו חפצים משתנים ולאיזה כיוון נעה התמונה. הפרסום מתאר זאת כאילוץ משותף על מצב עתידי של הגוף הרובוטי, זרימה אופטית ומשתנים חזותיים חבויים. 1
אילוצים כאלה אינם מבטיחים הבנה פיזיקלית קשיחה בכל מצב של מגע, חיכוך או הסתרה. הם כן מספקים לאימון אות אינטראקציה ישיר יותר משחזור וידאו בלבד.
LJM משתמשת גם בקשב משותף במבנה Mixture-of-Transformers. כך אסימוני ההסקה ואסימוני הווידאו מחליפים מידע בין שכבות המודל, במקום להעביר למחולל הווידאו וקטור תנאי קבוע פעם אחת בלבד. 1
הכוונה היא לתיאום דו־כיווני מתמשך:
בהשוואה להתניה חד־כיוונית וקבועה, החלפת מידע שכבתית מתאימה יותר לקשרי משוב בתהליכים ארוכים. למשל, כאשר מיקום החפץ, ההסתרה או מצב התנועה שלו משתנים במהלך היצירה, הייצוג של האינטראקציה אינו חייב להישאר מקובע לתנאי ההתחלה. החומרים הפומביים מתארים את המנגנון, אך אינם מספקים ניסויי אבלציה בלתי תלויים שמכמתים את תרומתו הנפרדת. 1
הדיווחים מתארים שימוש ב-32 מעבדי Zhenwu 810E במהלך קדם־האימון על DROID והמשך האימון על RoboTwin. 1 הנקודה החשובה אינה ש"מודלי עולם בווידאו נעשו זולים", אלא שהמבנה עשוי להפחית את הצורך של מחולל הווידאו לגלות בעקיפין, רק מפיקסלים, את מבנה האינטראקציה.
במילים אחרות, טענת היעילות נובעת מהטיה אינדוקטיבית: הפניית חלק מהחישוב לייצוג בעל משמעות אינטראקטיבית ברורה ולאילוצים נצפים, במקום להטיל על מודל וידאו יחיד ללמוד בו־זמנית שליטה בפעולה, מבנה מרחבי, דינמיקת אובייקטים ואיכות תמונה.
עם זאת, מספר המעבדים לבדו אינו מדד ישיר לכמות החישוב הכוללת. משך האימון, היקף הנתונים, מספר הפרמטרים, הרזולוציה, יעילות המקביליות ושלבי האימון עשויים להיות שונים מאוד בין מערכות. לכן המידע הקיים אינו מאפשר לחשב במדויק כמה חישוב LJM חסכה לעומת מודלים אחרים.
לפי דיווחים, Muka Robotics נוסדה באפריל 2026 ומתמקדת במודלי עולם לרובוטים בעולם הפיזי. ד"ר צ'י שיאווי מאוניברסיטת המדע והטכנולוגיה של הונג קונג (HKUST) הוזכר כמייסד, כנציג החוקי וכבעל השליטה בפועל; בדיווח אחר הוא מתואר כמייסד־שותף ומנכ"ל. 18
38
לעומת זאת, החומרים שסופקו אינם מציעים פרטים מהימנים ועקביים דיים על הרקע של כלל חברי הצוות או על מעסיקיהם ומעבדותיהם הקודמים. המסקנה הזהירה היא שרקע הדוקטורט של צ'י ב-HKUST נתמך בדיווחים, אך אין להרחיב ממנו להסיק מסקנות על קורות החיים של כל הצוות. 18
38
הביצועים של SisyphusWorld בטבלה תומכים בכיוון שכדאי להמשיך לבחון: מודל עולם לרובוטיקה לא חייב להסתמך רק על הגדלת מחולל הווידאו כדי לשפר ריאליזם. אפשר להפוך את תוצאות האינטראקציה למושא למידה מפורש, ולחבר אותן באופן הדוק ליצירת הווידאו.
אבל דירוג בטבלה אינו מוכיח לבדו שהסקה פיזיקלית מפורשת עדיפה באופן כללי על אימון בקנה מידה גדול. בוודאי שאין בו הוכחה ליתרון בכל רובוט, התפלגות נתונים או תנאי פריסה בעולם האמיתי. לשם כך דרושים דוחות טכניים פתוחים יותר: אבלציות של כל אילוץ פיזיקלי, הקשב המשותף ופיצול שני המומחים; וכן בחינות בין מערכי נתונים, בין גופי רובוט שונים ובקרת לולאה סגורה אמיתית.
נכון לעכשיו, המסקנה הסבירה היא ש-LJM מציעה השערה הנדסית משכנעת: כאשר מאמנים יחד, אך לא מערבבים לחלוטין, את חיזוי תוצאות האינטראקציה ואת היצירה החזותית, ייתכן שאפשר למקד טוב יותר את החישוב ולשפר במקביל עקביות פיזיקלית ואיכות ויזואלית. 1
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
לפי דיווחים פומביים, SisyphusWorld — ההגשה האנונימית של Muka Robotics — השיגה ציון EWMScore P של 73.06 ודורגה שנייה ב WorldArena, אחרי UNIS של שיאומי עם 73.64.
לפי דיווחים פומביים, SisyphusWorld — ההגשה האנונימית של Muka Robotics — השיגה ציון EWMScore P של 73.06 ודורגה שנייה ב WorldArena, אחרי UNIS של שיאומי עם 73.64. הרעיון המרכזי של LJM הוא לחזות תחילה במרחב חבוי את תוצאות האינטראקציה של פעולת הרובוט, ורק לאחר מכן להנחות באמצעותן את יצירת הווידאו.