Omega 0 คือ whole body world action model สำหรับหุ่นยนต์ฮิวแมนนอยด์ ซึ่งพยายามควบคุมการเคลื่อนที่ การมอง และการใช้มือภายในนโยบายเดียว แทนการแยกโมดูลเดินกับหยิบจับออกจากกัน สถาปัตยกรรม 3 ระยะประกอบด้วยการบีบอัดการเคลื่อนไหวทั้งร่างกาย การคาดการณ์ visual latents ในอนาคตจากภาพ ภาษา และ proprioception และการนำไปปรับใช้ก...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is Omega-0, the whole-body latent-prediction world action model released on August 21, 2026 by researchers from Nanyang Technological U. Article summary: Omega-0 (ω-0) is a single, whole-body “world action model” for humanoid robots: it takes a language instruction, visual observations, and robot state, predicts a future visual representation, then generates controller-co. Topic tags: general, academic, general web, user generated, government. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, wate
Omega-0 หรือ ω-0 คือ whole-body world action model สำหรับหุ่นยนต์ฮิวแมนนอยด์ กล่าวคือเป็นโมเดลที่พยายามควบคุมการเคลื่อนไหวทั้งร่างกายภายในระบบเดียว ไม่ได้แยก “การเดิน” และ “การหยิบจับสิ่งของ” เป็นปัญหาคนละส่วน 1
เมื่อได้รับคำสั่งภาษา โมเดลจะนำภาพจากสภาพแวดล้อมและข้อมูลสถานะของหุ่นยนต์มาประกอบกัน จากนั้นคาดการณ์ว่าสภาพที่หุ่นยนต์จะมองเห็นในอนาคตเป็นอย่างไร ก่อนสร้างชุดคำสั่งการเคลื่อนไหวที่สอดคล้องกัน เป้าหมายคือให้หุ่นยนต์ขยับฐาน ปรับท่าทางและมุมมอง รักษาสมดุล และใช้มือทำงานต่อเนื่องได้ในภารกิจเดียว
อย่างไรก็ตาม ผลลัพธ์ที่กล่าวถึงในที่นี้มาจากงานวิจัยและเป็นข้ออ้างของผู้เขียนงาน ไม่ใช่ผล benchmark ที่ได้รับการยืนยันโดยอิสระแล้ว 1
ระยะแรกใช้ Whole-Body FAST tokenizer แปลงเส้นทางการเคลื่อนไหวที่มีมิติสูงของทั้งร่างกายให้เป็น action tokens หรือ latents ที่กระชับกว่าเดิม วิธีนี้ช่วยให้โมเดลจัดการกับการเคลื่อนไหวที่ซับซ้อนได้ง่ายขึ้น เช่น การประสานขา ลำตัว และแขนในเวลาเดียวกัน 1
นักวิจัยยังปรับ backbone แบบ vision-language รุ่น Qwen3-VL-2B-Instruct ให้เข้ากับบริบทของหุ่นยนต์ พร้อมใช้ learnable tokens เพื่อแยกมุมมอง 2 แบบ ได้แก่
การแยกมุมมองเช่นนี้ทำให้โมเดลใช้ข้อมูลภาพจากกล้องภายนอกเพื่อช่วยในการฝึก แต่เมื่อใช้งานจริงยังอาศัยภาพจากกล้องของหุ่นยนต์เป็นหลัก 1
ระยะที่สองใช้เป้าหมายการฝึกแบบ V-JEPA-inspired latent prediction โมเดลจะผสานข้อมูลภาพ คำสั่งภาษา และ proprioception หรือข้อมูลที่บอกสถานะภายในของหุ่นยนต์ เช่น ตำแหน่ง ข้อต่อ และการเคลื่อนไหว แล้วคาดการณ์ visual features ในอนาคต แทนที่จะพยายามสร้างพิกเซลของภาพอนาคตขึ้นมาใหม่ทั้งหมด 1
จากนั้น diffusion transformer จะใช้ตัวแทนภาพที่คาดการณ์ไว้เพื่อสร้างลำดับ whole-body action latents ที่เข้ากันได้กับ controller ของหุ่นยนต์
แนวคิดสำคัญคือ หุ่นยนต์ไม่ได้เลือกการเคลื่อนไหวเพียงเพราะท่านั้นเป็นไปได้ทางกายภาพ แต่ยังพิจารณาด้วยว่าการเคลื่อนไหวนั้นน่าจะนำไปสู่สภาพภาพที่มีประโยชน์หรือไม่ ตัวอย่างเช่น หุ่นยนต์อาจเดินเข้าไป ปรับแนวลำตัวและกล้องให้เห็นวัตถุชัดขึ้น แล้วจึงยื่นมือไปหยิบสิ่งของ 1
ระยะที่สามนำการสาธิตการทำงานของมนุษย์จากแหล่งข้อมูลสาธารณะมาถ่ายโอนผ่านการทำ simulation-based grounding เข้าสู่ action-latent space ของหุ่นยนต์ ก่อนปรับโมเดลเพิ่มเติมด้วยข้อมูลจากหุ่นยนต์ฮิวแมนนอยด์ที่ทำงานบ้านจริง 1
ระหว่างการใช้งาน Omega-0 ไม่ได้วางแผนเส้นทางยาวทั้งหมดแล้วทำตามแบบเปิดลูป แต่จะสร้าง action chunk หรือชุดคำสั่งสั้น ๆ นำไปปฏิบัติ รับภาพและข้อมูลสถานะรอบใหม่ แล้ววางแผนอีกครั้ง วิธีการแบบ receding horizon ช่วยให้หุ่นยนต์แก้ทิศทางตามข้อมูลใหม่ได้ แทนที่จะเดินตามเส้นทางเดิมแม้สภาพแวดล้อมจะเปลี่ยนไป 1
งานวิจัยนี้ยังนำเสนอ Omega-HOME ชุดข้อมูลปฏิสัมพันธ์ในบ้านจริงที่เก็บจากหุ่นยนต์ฮิวแมนนอยด์ โดยมีข้อมูลรวม 40.3 ชั่วโมง ตอนการควบคุมทางไกล 4,827 ตอน และ งานบ้าน 24 ประเภท บันทึกที่อัตรา 30 Hz 1
ข้อมูลที่ซิงก์เข้าด้วยกันประกอบด้วย
งานต่าง ๆ ถูกจัดเป็น 8 กลุ่มความสามารถ ได้แก่
จุดเด่นของชุดข้อมูลนี้คือไม่ได้จำกัดอยู่แค่การหยิบวัตถุบนโต๊ะที่อยู่นิ่ง ๆ แต่ยังต้องอาศัยการขยับฐาน ปรับท่าทางและลำตัว รักษาสมดุล รวมถึงจัดการกับเฟอร์นิเจอร์ สิ่งของ หรือเครื่องมือในลำดับการทำงานที่ยาวขึ้น 1
ตามระเบียบการทดลองที่อธิบายในงานวิจัย งาน 11 ประเภทที่ใช้ประเมินผลถูกนำออกจากข้อมูลฝึกของ Omega-HOME ข้อมูลหุ่นยนต์ส่วนที่เหลือถูกนำไปรวมกับการสาธิตของมนุษย์จากสาธารณะเพื่อใช้ในการ pretraining ส่วนข้อมูลจากบ้านจริงถูกใช้สำหรับ grounding และ post-training 1
การแบ่งข้อมูลแบบนี้ช่วยลดความเสี่ยงที่โมเดลจะเพียงจดจำการสาธิตชุดเดียวกับที่ปรากฏใน test set แต่ไม่ได้เป็นหลักประกันอย่างสมบูรณ์ว่าหุ่นยนต์จะ generalize ได้ดีในโลกจริง เพราะห้อง วัตถุ โครงสร้างงาน ฮาร์ดแวร์ หรือวิธีเก็บข้อมูลอาจยังมีส่วนคล้ายกันอยู่
การทดสอบที่เข้มงวดกว่านี้ควรเป็นการทำซ้ำโดยทีมอิสระ ในบ้านใหม่และบนแพลตฟอร์มหุ่นยนต์ฮิวแมนนอยด์ที่แตกต่างออกไป
ในการทดสอบ งาน loco-manipulation ในบ้านจริง 11 งาน ผู้เขียนรายงานว่า Omega-0 มีอัตราความสำเร็จเฉลี่ย 81.8% โดยใช้โมเดลเดียว แทนการใช้นโยบายแยกตามงาน หัว action head หลายชุด หรือโมดูลเดินและหยิบจับที่ทำงานแยกจากกัน 1
งานทดสอบครอบคลุมการจัดการสิ่งของบนโต๊ะ การทำความสะอาด งานซักผ้า การย้ายสิ่งของ การโต้ตอบกับเครื่องใช้ไฟฟ้า และ mobile manipulation โดยงานวิจัยระบุว่า Omega-0 ทำได้ดีกว่า baseline ที่นำมาเปรียบเทียบ ได้แก่ π-0.5, EgoVLA, GR00T-N1.7 และ ψ-0 ในชุดทดสอบนี้ 1
ข้อมูลที่มีอยู่ไม่ได้แสดงตัวเลขรวมของ baseline แต่ละรุ่นอย่างชัดเจนเพียงพอ ดังนั้นข้อสรุปที่รอบคอบที่สุดคือ Omega-0 มีตัวเลขที่ผู้เขียนรายงานไว้ที่ 81.8% และอยู่เหนือระบบที่นำมาเปรียบเทียบในลำดับผลการทดสอบ ไม่ควรขยายความเป็นการเปรียบเทียบเชิงตัวเลขที่ละเอียดกว่านี้โดยไม่มีข้อมูลรองรับ 1
ความสำคัญหลักของ Omega-0 อยู่ที่แนวทางด้านสถาปัตยกรรม โมเดลนี้แสดงให้เห็นทิศทางที่การคาดการณ์ latent ของการรับรู้ในอนาคตสามารถเชื่อมการสาธิตของมนุษย์ ภาษา การมองเห็น proprioception และการควบคุมร่างกายทั้งตัวของหุ่นยนต์เข้าด้วยกัน 1
แทนที่จะเรียนรู้เพียงว่า “เมื่อเห็นภาพนี้ควรขยับอย่างไร” โมเดลพยายามเชื่อมการเคลื่อนไหวเข้ากับสภาพที่การเคลื่อนไหวนั้นจะนำไปสู่ แนวคิดนี้มีประโยชน์อย่างยิ่งกับงานที่หุ่นยนต์ต้องตัดสินใจพร้อมกันว่าจะยืนตรงไหน มองไปทางใด และใช้มือทำอะไร
แต่ผลลัพธ์ดังกล่าวยังไม่ได้หมายความว่าหุ่นยนต์ฮิวแมนนอยด์พร้อมทำงานบ้านทั่วไปโดยไม่มีการควบคุมดูแล ความท้าทายสำคัญยังมีอีกหลายด้าน
ข้อสรุปที่แม่นยำที่สุดคือ Omega-0 เป็นก้าวสำคัญสู่การควบคุมการเดินและการหยิบจับของหุ่นยนต์ฮิวแมนนอยด์แบบบูรณาการ ส่วนตัวเลข 81.8% เป็นผลการวิจัยที่แข็งแรงใน benchmark เฉพาะชุดนี้ ไม่ใช่หลักฐานว่าหุ่นยนต์พร้อมทำงานบ้านทุกประเภทได้อย่างน่าเชื่อถือโดยไม่มีคนกำกับ
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Omega 0 คือ whole body world action model สำหรับหุ่นยนต์ฮิวแมนนอยด์ ซึ่งพยายามควบคุมการเคลื่อนที่ การมอง และการใช้มือภายในนโยบายเดียว แทนการแยกโมดูลเดินกับหยิบจับออกจากกัน
Omega 0 คือ whole body world action model สำหรับหุ่นยนต์ฮิวแมนนอยด์ ซึ่งพยายามควบคุมการเคลื่อนที่ การมอง และการใช้มือภายในนโยบายเดียว แทนการแยกโมดูลเดินกับหยิบจับออกจากกัน สถาปัตยกรรม 3 ระยะประกอบด้วยการบีบอัดการเคลื่อนไหวทั้งร่างกาย การคาดการณ์ visual latents ในอนาคตจากภาพ ภาษา และ proprioception และการนำไปปรับใช้กับข้อมูลหุ่นยนต์ในบ้านจริง
ชุดข้อมูล Omega HOME มีข้อมูล 40.3 ชั่วโมง ตอนการควบคุมทางไกล 4,827 ตอน และงานบ้าน 24 ประเภท พร้อมข้อมูลภาพหลายมุม ภาษา สถานะของหุ่นยนต์ และการเคลื่อนไหวทั้งร่างกาย