รายงานสาธารณะระบุว่า SisyphusWorld ซึ่งเป็นชื่อส่งแบบไม่เปิดเผยตัวตนของ Muka Robotics ทำคะแนน EWMScore P ได้ 73.06 ครองอันดับ 2 บนกระดาน WorldArena รองจาก Xiaomi UNIS ที่ 73.64 โดยใช้ GPU Zhenwu 810E จำนวน 32 ตัวในการ... LJM ผสานผู้เชี่ยวชาญด้านการให้เหตุผลจาก Qwen3 VL 2B กับผู้เชี่ยวชาญสร้างวิดีโอ Wan2.2 TI2V 5B แล...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: How did four-month-old Muka Robotics’ anonymously submitted SisyphusWorld LJM (Latent Joint-conditional Model) achieve second place globally. Article summary: Muka Robotics’ result appears to come from architectural efficiency: LJM separates predicting the physical consequences of an action from rendering a realistic video, then couples those jobs tightly rather than asking on. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
สิ่งที่ทำให้ LJM (Latent Joint-conditional Model) ของ Muka Robotics น่าสนใจ ไม่ใช่ข้อสรุปว่า “คอมพิวต์น้อยย่อมชนะคอมพิวต์มาก” แต่เป็นวิธีจัดสรรงานให้โมเดลต่างออกไป: แยกการคาดการณ์ว่า การกระทำของหุ่นยนต์จะส่งผลอะไรต่อโลกจริง ออกจากการเรนเดอร์ผลนั้นเป็นวิดีโอที่ต่อเนื่องสมจริง แล้วเชื่อมสองกระบวนการนี้เข้าด้วยกัน
รายงานระบุว่า Muka ส่งโมเดลภายใต้นามแฝง SisyphusWorld และได้คะแนน EWMScore_P 73.06 บนกระดานสาธารณะ WorldArena เป็นอันดับ 2 รองจาก Xiaomi UNIS ที่ 73.64 โดยมีคะแนนย่อย 89.17 ด้านคุณภาพการเคลื่อนไหว, 92.60 ด้านความแม่นยำเชิง 3 มิติ และ 85.93 ด้านความสามารถในการควบคุม ทั้งยังระบุว่าการฝึกใช้ GPU Zhenwu 810E จำนวน 32 ตัว 1 ผลเหล่านี้น่าจับตา แต่หลักฐานที่เผยแพร่ในขณะนี้ส่วนใหญ่มาจากรายงานแพลตฟอร์มและสื่อ จึงยังไม่ใช่การทดลองทำซ้ำอย่างอิสระ หรือการศึกษา ablation ที่เปิดเผยครบถ้วน
โมเดล diffusion สำหรับสร้างวิดีโอที่มีการกระทำเป็นเงื่อนไข มักป้อนค่าการเคลื่อนไหวของหุ่นยนต์ซึ่งมีมิติต่ำเข้าไปในโมเดลสร้างวิดีโอโดยตรง วิธีนี้ทำให้วิดีโอเปลี่ยนตามคำสั่งการเคลื่อนไหวได้ แต่โมเดลยังต้องอนุมานจากเป้าหมายการเรียนรู้ระดับวิดีโอหรือพิกเซลเองว่า ตัวเลขการกระทำนั้นหมายถึงอะไรในเชิงกายภาพ เช่น แขนกลสัมผัสวัตถุหรือไม่ คีมจับหยิบวัตถุได้หรือไม่ วัตถุควรเคลื่อนไปทางใด และความสัมพันธ์เชิงพื้นที่ยังสอดคล้องกันหรือเปล่า
LJM พยายามทำให้ขั้นตอนนี้ชัดเจนขึ้น โดยแปลงคำสั่งภาษา ประวัติภาพ การสังเกต ณ จุดอ้างอิงปัจจุบัน และการกระทำในอนาคต ให้เป็น ตัวแปรแฝงของปฏิสัมพันธ์ ที่เรียนรู้ได้ จากนั้นใช้ตัวแปรดังกล่าวเป็นข้อจำกัดต่อการสร้างวิดีโออนาคต 1 ดังนั้น โมเดลวิดีโอจึงไม่ต้องแบกรับงานทำความเข้าใจการกระทำ คาดการณ์ปฏิสัมพันธ์ และสร้างภาพทั้งหมดเพียงลำพัง
ไม่ได้หมายความว่าการสร้างวิดีโอสำคัญน้อยลง ตรงกันข้าม แนวคิดคือให้ตัวสร้างวิดีโอทุ่มความสามารถไปกับความต่อเนื่องของภาพและรายละเอียดภาพมากขึ้น ขณะที่การคาดการณ์ปฏิสัมพันธ์ระหว่างหุ่นยนต์กับวัตถุมีชั้นตัวแทนเฉพาะรับผิดชอบ
LJM ประกอบด้วยผู้เชี่ยวชาญสองส่วนที่ทำงานร่วมกัน
อาจเปรียบได้กับการมีทั้ง “บทของปฏิสัมพันธ์” และ “ทีมเรนเดอร์ภาพ” ส่วนแรกบอกผลที่ควรเกิดจากการกระทำ ส่วนที่สองถ่ายทอดผลนั้นเป็นอนาคตเชิงภาพที่น่าเชื่อถือ การแบ่งงานเช่นนี้อธิบายได้อย่างสมเหตุผลว่าทำไมสถาปัตยกรรมนี้อาจทำผลงานด้านการเคลื่อนไหว พื้นที่สามมิติ และการควบคุมได้ดีภายใต้ทรัพยากรฝึกที่จำกัดกว่าเดิม แต่ยังเป็นคำอธิบายเชิงสถาปัตยกรรม ไม่ใช่ข้อพิสูจน์เชิงเหตุและผลขั้นสุดท้าย
การเพิ่มตัวแปรแฝงเพียงอย่างเดียวไม่ได้รับประกันว่ามันจะสะท้อนกระบวนการทางกายภาพจริง LJM จึงเพิ่มข้อจำกัดการทำนาย 3 ประเภทที่ผูกกับข้อมูลซึ่งสังเกตได้
ความสำคัญของเป้าหมายเหล่านี้คือ ตัวแปรแฝงไม่ควรมีประโยชน์เพียงเพื่อสร้างภาพที่ “ดูสมเหตุสมผล” แต่ต้องอธิบายได้ว่าหุ่นยนต์เคลื่อนไปที่ใด วัตถุใดเปลี่ยนแปลง และการเคลื่อนที่ในภาพไปในทิศทางใด รายงานอธิบายแนวทางนี้ว่าเป็นการกำกับร่วมกันของสถานะในอนาคต, optical flow และตัวแปรแฝงเชิงภาพ 1
แน่นอนว่าเงื่อนไขเหล่านี้ไม่ได้รับประกันความเข้าใจฟิสิกส์อย่างเคร่งครัดในทุกกรณี เช่น การสัมผัส แรงเสียดทาน หรือการบังวัตถุ แต่ให้สัญญาณการเรียนรู้เรื่องปฏิสัมพันธ์ที่ตรงกว่าการสร้างวิดีโอคืนจากพิกเซลเพียงอย่างเดียว
LJM ใช้ shared attention ในรูปแบบ Mixture-of-Transformers เพื่อให้ reasoning tokens และ video tokens แลกเปลี่ยนข้อมูลกันตามชั้นของโมเดล แทนที่จะส่งเวกเตอร์เงื่อนไขคงที่เข้าไปในตัวสร้างวิดีโอเพียงครั้งเดียว 1
เจตนาของการออกแบบนี้คือการประสานงานแบบสองทางอย่างต่อเนื่อง
เมื่อเทียบกับการป้อนเงื่อนไขแบบทางเดียวและคงที่ การแลกเปลี่ยนข้อมูลทีละชั้นอาจเหมาะกับกระบวนการที่ยาวขึ้น ซึ่งตำแหน่งวัตถุ การบัง หรือสถานะการเคลื่อนไหวเปลี่ยนไประหว่างการสร้างวิดีโอ อย่างไรก็ดี เอกสารสาธารณะอธิบายกลไกนี้ไว้ แต่ยังไม่มีผล ablation อิสระที่มากพอจะวัดผลงานเฉพาะของมันได้ 1
รายงานระบุว่า LJM ฝึกด้วย GPU Zhenwu 810E จำนวน 32 ตัว ทั้งในช่วง pretraining บน DROID และการฝึกต่อบน RoboTwin 1 ประเด็นสำคัญจึงไม่ใช่ว่าโมเดลวิดีโอโลกมีต้นทุนต่ำลงโดยอัตโนมัติ แต่เป็นความเป็นไปได้ที่สถาปัตยกรรมนี้ลดภาระของตัวสร้างวิดีโอในการค้นพบโครงสร้างของปฏิสัมพันธ์จากพิกเซลทางอ้อม
กล่าวอีกแบบหนึ่ง ข้ออ้างด้านประสิทธิภาพมาจาก inductive bias หรือการใส่สมมติฐานเชิงโครงสร้างให้โมเดล: ใช้ทรัพยากรกับตัวแทนแฝงที่มีความหมายด้านปฏิสัมพันธ์ชัดเจนและมีข้อกำกับที่สังเกตได้ แทนการพึ่งโมเดลวิดีโอเดี่ยวให้เรียนรู้การควบคุม พื้นที่ พลวัตของวัตถุ และคุณภาพภาพพร้อมกันทั้งหมด
แต่จำนวน GPU เพียงอย่างเดียวไม่สามารถใช้เทียบปริมาณคอมพิวต์รวมได้โดยตรง เพราะระยะเวลาฝึก ขนาดข้อมูล จำนวนพารามิเตอร์ ความละเอียด ประสิทธิภาพการประมวลผลแบบขนาน และขั้นตอนการฝึกของแต่ละระบบอาจต่างกันมาก ข้อมูลปัจจุบันจึงยังไม่พอจะคำนวณอย่างเคร่งครัดว่า LJM ประหยัดคอมพิวต์รวมได้มากกว่าระบบอื่นเท่าใด
รายงานสาธารณะระบุว่า Muka Robotics ก่อตั้งในเดือนเมษายน 2026 โดยมุ่งพัฒนา world model สำหรับหุ่นยนต์ในโลกกายภาพจริง และระบุชื่อ ฉือ เสี่ยวเว่ย (Chi Xiaowei) ผู้จบปริญญาเอกจากมหาวิทยาลัยวิทยาศาสตร์และเทคโนโลยีฮ่องกง เป็นผู้ก่อตั้ง รวมถึงเป็นผู้แทนตามกฎหมายและผู้ควบคุมกิจการตามข้อมูลทะเบียนที่รายงานไว้ 38 อีกแหล่งเรียกเขาว่าเป็นผู้ร่วมก่อตั้งและ CEO
18
อย่างไรก็ตาม ข้อมูลที่ให้มายังไม่มีรายละเอียดที่น่าเชื่อถือและสอดคล้องกันมากพอจะยืนยันว่าทีมทั้งหมดมาจากบริษัท ห้องปฏิบัติการ หรือสถาบันใดบ้าง ข้อสรุปที่รอบคอบกว่าคือ มีรายงานรองรับภูมิหลังระดับปริญญาเอกของฉือ เสี่ยวเว่ยจากมหาวิทยาลัยวิทยาศาสตร์และเทคโนโลยีฮ่องกง แต่ไม่ควรขยายความไปเป็นประวัติทีมทั้งหมด 18
38
ผลงานบนกระดานของ SisyphusWorld สนับสนุนแนวทางที่ควรทดสอบต่อไป: world model สำหรับหุ่นยนต์อาจไม่จำเป็นต้องไล่ความสมจริงด้วยการขยายขนาดตัวสร้างวิดีโอเท่านั้น แต่สามารถทำให้ผลของปฏิสัมพันธ์เป็นสิ่งที่เรียนรู้อย่างชัดแจ้ง แล้วเชื่อมเข้ากับการสร้างวิดีโออย่างแน่นแฟ้น
แต่การติดอันดับบนลีดเดอร์บอร์ดเพียงอย่างเดียว ยังพิสูจน์ไม่ได้ว่า “การให้เหตุผลทางกายภาพแบบชัดแจ้ง” เหนือกว่าการขยายขนาดการฝึกในทุกกรณี และไม่ได้ยืนยันว่า LJM จะได้เปรียบกับหุ่นยนต์ทุกแบบ ชุดข้อมูลทุกการกระจายตัว หรือการใช้งานควบคุมจริงทุกสภาวะ การยืนยันประเด็นนี้ต้องมีรายงานเทคนิคสาธารณะที่ครบกว่านี้ รวมถึงการทดลองตัดส่วนประกอบ เช่น ข้อกำกับทางกายภาพแต่ละชนิด, shared attention และการแบ่งงานของผู้เชี่ยวชาญ ตลอดจนการประเมินข้ามชุดข้อมูล ข้ามร่างกายหุ่นยนต์ และการควบคุมแบบวงปิดในโลกจริง
ข้อสรุปที่สมเหตุสมผลที่สุดในตอนนี้คือ LJM เสนอสมมติฐานทางวิศวกรรมที่น่าเชื่อถือ: หากฝึกการคาดการณ์ปฏิสัมพันธ์และการสร้างภาพร่วมกัน แต่ไม่ปนเป็นงานเดียวกันทั้งหมด โมเดลอาจใช้คอมพิวต์ได้ตรงจุดขึ้น พร้อมยกระดับทั้งความสอดคล้องทางกายภาพและคุณภาพภาพได้ 1
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
รายงานสาธารณะระบุว่า SisyphusWorld ซึ่งเป็นชื่อส่งแบบไม่เปิดเผยตัวตนของ Muka Robotics ทำคะแนน EWMScore P ได้ 73.06 ครองอันดับ 2 บนกระดาน WorldArena รองจาก Xiaomi UNIS ที่ 73.64 โดยใช้ GPU Zhenwu 810E จำนวน 32 ตัวในการ...
รายงานสาธารณะระบุว่า SisyphusWorld ซึ่งเป็นชื่อส่งแบบไม่เปิดเผยตัวตนของ Muka Robotics ทำคะแนน EWMScore P ได้ 73.06 ครองอันดับ 2 บนกระดาน WorldArena รองจาก Xiaomi UNIS ที่ 73.64 โดยใช้ GPU Zhenwu 810E จำนวน 32 ตัวในการ... LJM ผสานผู้เชี่ยวชาญด้านการให้เหตุผลจาก Qwen3 VL 2B กับผู้เชี่ยวชาญสร้างวิดีโอ Wan2.2 TI2V 5B และกำกับตัวแปรแฝงด้วยตำแหน่งปลายแขนกลแบบ 3 มิติ การเคลื่อนไหวของวัตถุ และทิศทางของ optical flow แต่ข้อมูลที่เปิดเผยยังไม่เพ...