HOST จาก Beijing Institute of Technology, X Square Robot และ Tsinghua University เรียนทักษะใหม่จากวิดีโอมนุษย์เฉลี่ย 29 วินาที โดยไม่อัปเดตพารามิเตอร์โมเดล และทำสำเร็จเฉลี่ย 62% ในงานใหม่ 50 งาน [1] GEN 1.5 ของ Generalist AI ใช้วิดีโอสาธิตความยาวราว 3–12 วินาทีเป็น “พรอมป์ทางกายภาพ” เพื่อสร้างคำสั่งการเคลื่อนไหว โดย...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: How do the two research efforts, HOST from Beijing Institute of Technology, X Square Robot, and Tsinghua University and GEN 1.5 from General. Article summary: Both efforts move robot learning from task specific retraining toward inference time imitation: a pretrained system treats a brief demonstration as context and immediately controls the robot accordingly.. Topic tags: general web, ai safety, prompt engineering, ai, workflow. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with
แนวคิดสำคัญของทั้งสองงานวิจัยคือการย้ายการเรียนรู้หุ่นยนต์จากการฝึกใหม่เฉพาะงาน ไปสู่การเลียนแบบ ณ เวลาที่ใช้งานจริง หรือ inference-time imitation
แทนที่จะเก็บข้อมูลหุ่นยนต์เพิ่มหลายร้อยตัวอย่างแล้วปรับน้ำหนักโมเดล ผู้ใช้เพียงแสดงวิดีโอสั้น ๆ ให้ระบบดู โมเดลที่ผ่านการฝึกล่วงหน้าจะใช้คลิปนั้นเป็นบริบท และสั่งให้หุ่นยนต์ลงมือทำทันที
HOST มีหลักฐานเชิงวิชาการที่เป็นระบบกว่า ขณะที่ GEN-1.5 เป็นผลลัพธ์ที่น่าสนใจจากบริษัท แต่ยังไม่มีการยืนยันโดยหน่วยงานอิสระในระดับใกล้เคียงกัน
HOST เป็นตัวอย่างที่ชัดเจนของการเรียนรู้จากการสังเกตระหว่างมนุษย์กับหุ่นยนต์ หุ่นยนต์ไม่ได้พยายามถอดท่าทางมือของมนุษย์แล้วเล่นซ้ำแบบตรง ๆ แต่ใช้วิดีโอเป็นแผนที่อ้างอิงตามความคืบหน้าของงาน ขณะเดียวกันก็ประเมินภาพจากมุมมองของตัวเองและสถานะร่างกายของตัวเองเพื่อเลือกการเคลื่อนไหวที่เหมาะสม
จุดนี้สำคัญ เพราะวิดีโอมนุษย์กับหุ่นยนต์อาจมีรูปร่าง แขนกล และมุมมองไม่เหมือนกัน การเลียนแบบพิกัดการเคลื่อนไหวแบบหนึ่งต่อหนึ่งจึงอาจใช้ไม่ได้ HOST พยายามตอบคำถามว่า “ตอนนี้หุ่นยนต์อยู่ในขั้นตอนไหนของงาน และควรทำอะไรต่อเพื่อไปถึงผลลัพธ์เดียวกัน”
การทดสอบกับงานใหม่ 50 งาน งานละ 20 ครั้ง ให้หลักฐานว่าระบบถ่ายโอนทักษะไปยังวัตถุ เครื่องมือ และรูปแบบการหยิบจับที่หลากหลายได้ อย่างไรก็ตาม อัตราความสำเร็จเฉลี่ย 62% ก็แปลว่ายังมีโอกาสล้มเหลวเกือบ 4 ครั้งจากทุก 10 ครั้ง และยังไม่ใช่ความน่าเชื่อถือระดับพร้อมใช้กับทุกสถานการณ์
ในการทดสอบความทนทาน HOST ยังคงรักษาผลลัพธ์ส่วนใหญ่ของค่าเฉลี่ย 62% เมื่อเปลี่ยนแสง วัตถุ ฉาก หรือมีมนุษย์รบกวน โดยรายงานว่าผลลดลง 1%, 4%, 6% และ 9% ตามลำดับ
GEN-1.5 อธิบายแนวคิดเดียวกันในกรอบของการเรียนรู้ในบริบท หรือ in-context learning ที่เกิดขึ้นในโมเดลหุ่นยนต์ขนาดใหญ่ วิดีโอสาธิตไม่ได้ถูกนำไปฝึกนโยบายใหม่ แต่ถูกใส่ไว้ในหน้าต่างบริบทให้โมเดลใช้เป็นคำสั่งระหว่างการลงมือทำ
บริษัท Generalist AI ระบุว่า GEN-1.5 สามารถรับการสาธิตเพียง 3–12 วินาที แล้วพยายามทำงานทันทีโดยไม่ปรับน้ำหนักโมเดล ตัวอย่างที่บริษัทนำเสนอมีทั้งการเปิดขวดโหล รูดซิปกระเป๋า กวาดบล็อกลงชาม และการถ่ายโอนทักษะจากมือมนุษย์ไปยังหุ่นยนต์ นอกจากนี้ยังกล่าวถึงการต่อพฤติกรรมสองอย่างเข้าด้วยกัน การฟื้นตัวเมื่อทำพลาด การใช้เครื่องมือรูปแบบใหม่ และการนำวิดีโอจากการจำลองไปสู่การทำงานจริง
แต่คำว่า “ไม่ต้องฝึกใหม่” ของ GEN-1.5 ต้องตีความให้แม่นยำ การใช้การสาธิตเดียวเป็นพรอมป์ไม่ต้องอัปเดตพารามิเตอร์ก็จริง แต่สำหรับงานที่ยากขึ้น บริษัทมีเส้นทางแบบ few-shot ซึ่งใช้ gradient 1–10 ขั้นจากข้อมูลไม่กี่นาที ดังนั้นระบบไม่ได้ปลอดจากการปรับโมเดลในทุกกรณี
ความเร็วของทั้งสองระบบไม่ได้หมายความว่าหุ่นยนต์ไม่เคยได้รับการฝึกมาก่อน ตรงกันข้าม โมเดลต้องอาศัยการฝึกล่วงหน้าขนาดใหญ่เพื่อสะสมความรู้เกี่ยวกับการมองเห็น วัตถุ การสัมผัส การควบคุม และความสัมพันธ์ระหว่างการกระทำกับผลลัพธ์
สิ่งที่ลดลงคือค่าใช้จ่ายในการสอน “งานใหม่” ให้กับผู้ใช้ปลายทาง การฝึกขนาดใหญ่ถูกทำไว้ล่วงหน้าแล้ว ส่วนวิดีโอสั้นทำหน้าที่กำหนดเป้าหมาย ขั้นตอน และปฏิสัมพันธ์ที่ต้องการในครั้งนั้น
HOST ทำให้การแลกเปลี่ยนนี้เห็นเป็นตัวเลขชัดเจน: ใช้เวลารับทักษะเฉลี่ย 29 วินาที และอ้างว่าเร็วกว่า supervised fine-tuning ราว 507 เท่า นี่จึงไม่ใช่การแทนที่การฝึกทั้งหมด แต่เป็นการนำต้นทุนการฝึกพื้นฐานมาหารเฉลี่ย เพื่อให้การสอนงานเฉพาะกิจทำได้เร็วขึ้นมาก
หากเทคโนโลยีพัฒนาไปถึงจุดที่น่าเชื่อถือ วิธีสอนหุ่นยนต์อาจใกล้เคียงกับวิธีที่มนุษย์สอนกันมากขึ้น นั่นคือ “ทำให้ดู” แทนการเขียนโปรแกรมทีละบรรทัด ออกแบบรางวัล เก็บข้อมูลการบังคับหุ่นยนต์จำนวนมาก หรือรอการฝึกโมเดลรอบใหม่
แนวทางนี้ยังอาจช่วยลดปัญหาการลืมทักษะเดิม เพราะการเรียนรู้เกิดขึ้นในบริบทของการใช้งาน โดยไม่เปลี่ยนน้ำหนักโมเดลหลัก HOST ระบุว่าสามารถเก็บทักษะเดิมไว้ได้ ขณะที่การ fine-tuning แบบเดิมมีความเสี่ยงทำให้ความสามารถก่อนหน้าลดลง
HOST ยังเป็นหลักฐานจากการทดลองในห้องแล็บ ผลลัพธ์ 62% มาจากงานใหม่ 50 งานที่คัดเลือกและทดสอบภายใต้เงื่อนไขควบคุม จึงยังไม่ยืนยันความน่าเชื่อถือในบ้าน โรงงาน งานที่มีหลายขั้นตอนยาวนาน งานที่เกี่ยวข้องกับความปลอดภัย หรือสภาพแวดล้อมที่ควบคุมไม่ได้
GEN-1.5 ตรวจสอบได้ยากกว่า ข้อมูลเกี่ยวกับตัวโมเดล ขอบเขตงาน ระยะเวลาฝึก การไม่มีข้อมูลจำลองใน pretraining ระยะเวลาของพรอมป์ และความสามารถด้านการปรับตัว ล้วนมาจาก Generalist AI หรือการประกาศของบริษัทเป็นหลัก
ยังไม่มีเกณฑ์เปรียบเทียบสาธารณะที่เทียบกันได้ สำหรับ GEN-1.5 ยังขาดข้อมูลอิสระเกี่ยวกับจำนวนงานที่เป็นมาตรฐาน วิธีสุ่มทดลอง จำนวนครั้งที่ทดสอบ อัตราความสำเร็จ one-shot รวม การเปรียบเทียบกับ baseline การเปิดเผยโมเดลหรือข้อมูล และการทำซ้ำโดยบุคคลที่สาม ดังนั้นการสาธิตในปัจจุบันจึงเป็นหลักฐานถึงศักยภาพ มากกว่าจะเป็นการยืนยันว่า GEN-1.5 ทำลายสถิติด้านประสิทธิภาพแล้ว
เมื่อพิจารณาร่วมกัน HOST เป็นหลักฐานว่าการให้หุ่นยนต์เรียนทักษะใหม่จากวิดีโอมนุษย์เพียงคลิปเดียว โดยไม่อัปเดตพารามิเตอร์ สามารถทำงานได้ในชุดทดสอบการหยิบจับที่กำหนดไว้ ส่วน GEN-1.5 ชี้ให้เห็นว่าการฝึกล่วงหน้าด้านกายภาพในวงกว้างอาจทำให้ความสามารถลักษณะเดียวกันเกิดขึ้นเป็นพฤติกรรมในบริบทของโมเดลหุ่นยนต์อเนกประสงค์
ทิศทางนี้มีศักยภาพอย่างมาก แต่ข้อสรุปที่รอบคอบกว่าคือ การเรียนรู้จากการสังเกตกำลังเริ่มเป็นรูปธรรม ยังไม่ใช่สิ่งที่พิสูจน์แล้วว่าสามารถแทนที่การตรวจสอบงานอย่างเข้มงวด วิศวกรรมความปลอดภัย และการปรับระบบให้เข้ากับสภาพแวดล้อมจริงที่คาดเดาไม่ได้
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
HOST จาก Beijing Institute of Technology, X Square Robot และ Tsinghua University เรียนทักษะใหม่จากวิดีโอมนุษย์เฉลี่ย 29 วินาที โดยไม่อัปเดตพารามิเตอร์โมเดล และทำสำเร็จเฉลี่ย 62% ในงานใหม่ 50 งาน [1]
HOST จาก Beijing Institute of Technology, X Square Robot และ Tsinghua University เรียนทักษะใหม่จากวิดีโอมนุษย์เฉลี่ย 29 วินาที โดยไม่อัปเดตพารามิเตอร์โมเดล และทำสำเร็จเฉลี่ย 62% ในงานใหม่ 50 งาน [1] GEN 1.5 ของ Generalist AI ใช้วิดีโอสาธิตความยาวราว 3–12 วินาทีเป็น “พรอมป์ทางกายภาพ” เพื่อสร้างคำสั่งการเคลื่อนไหว โดยไม่ต้องทำ gradient update หรือ fine tuning ตามที่บริษัทระบุ [26]
ทั้งสองระบบไม่ได้เรียนรู้จากศูนย์ แต่ใช้ความรู้ด้านฟิสิกส์และการควบคุมที่สะสมจากการฝึกล่วงหน้าขนาดใหญ่ ก่อนนำวิดีโอสั้นมาใช้ระบุงานใหม่