LightNav 0 รวมการทำตามคำสั่ง การไปหาเป้าหมายที่ระบุด้วยคำพูด และการติดตามเป้าหมายด้วยภาพไว้ในโมเดลเดียว [1][2] ระบบแยก «จุดหมายที่ต้องการไป» ออกจาก «เส้นทางการเคลื่อนที่ของหุ่นยนต์แต่ละแบบ» เพื่อเอื้อให้ใช้สิ่งที่เรียนรู้ร่วมกันได้ [1][5] Light Origins รายงานว่าใช้ฉากจากโลกจริงกว่า 2,000 ฉากสร้างประสบการณ์ฝึกในโลกจำ...
เผยแพร่โดยแก้ไขด้วย GPT-6 Solรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is Light Origins’ open-sourced LightNav-0, and how do its Qwen3-VL-4B architecture, shared token interface, Real2Sim2Real data pipeline. Article summary: LightNav-0 is Light Origins’ open-sourced, general-purpose robot navigation model built on Qwen3-VL-4B. Its aim is to turn a pretrained vision-language model into a policy that can follow instructions, navigate to named . Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
การสอนหุ่นยนต์นำทางด้วยการให้คนบังคับและบันทึกตัวอย่างซ้ำ ๆ สำหรับหุ่นยนต์หรือภารกิจแต่ละแบบเป็นสิ่งที่ Light Origins ต้องการลดการพึ่งพา LightNav-0 จึงถูกออกแบบให้เป็นโมเดลนำทางร่วมตัวเดียว โดยต่อยอดจาก Qwen3-VL-4B ซึ่งเป็นโมเดลที่ประมวลผลทั้งภาพและภาษา ให้รองรับทั้งการทำตามคำสั่ง การไปหาวัตถุที่ระบุด้วยภาษาทั่วไป และการติดตามเป้าหมายที่เห็นในภาพ 1
2
8
แทนที่จะสร้างส่วนทำนายแยกสำหรับแต่ละงาน LightNav-0 ใช้ระบบโทเคนร่วมในการสื่อสารการนำทาง โทเคนชี้เป้าแบบสองช่องทาง แทนเจตนาว่าควรไปทางไหนในรูปแบบที่ออกแบบให้ใช้ข้ามงาน ฉาก และรูปแบบตัวหุ่นยนต์ได้ ส่วน โทเคนการกระทำแบบ residual vector quantization แทนเส้นทางการเคลื่อนที่ที่ละเอียดและเฉพาะกับหุ่นยนต์แต่ละแบบ โมเดลยังบีบอัดข้อมูลภาพที่สังเกตมาต่างช่วงเวลา เพื่อใช้บริบทจากภาพก่อนหน้าประกอบการตัดสินใจ 1
5
พูดให้ง่ายคือ โมเดลพยายามแยก «จะไปไหน» ออกจาก «หุ่นยนต์ตัวนี้ต้องขยับอย่างไร» การแยกสองส่วนนี้เป็นแนวทางเพื่อถ่ายโอนความสามารถระหว่างหุ่นยนต์ ไม่ใช่คำรับประกันว่าหุ่นยนต์รุ่นที่ไม่เคยพบจะใช้งานได้ทันทีโดยไม่ต้องปรับแต่ง 1
5
หัวใจอีกส่วนคือกระบวนการ Real2Sim2Real บริษัทระบุว่านำฉากโลกจริงจากอินเทอร์เน็ตกว่า 2,000 ฉาก มาสร้างเป็นสภาพแวดล้อมจำลองที่นำกลับมาใช้ได้ และสร้างประสบการณ์นำทางที่เชื่อมภาพ ภาษา และการกระทำมากกว่า 4,000 ชั่วโมง วิธีนี้เปิดทางให้สร้างสถานการณ์ฝึกที่หลากหลายในโลกจำลอง แทนการพึ่งตัวอย่างที่คนบังคับหุ่นยนต์เก็บแยกสำหรับทุกกรณี อย่างไรก็ตาม ตัวเลขดังกล่าวเป็นปริมาณข้อมูลที่บริษัทรายงาน ไม่ใช่ผลวัดว่าประหยัดค่าเก็บข้อมูลในโลกจริงได้เท่าไร 8
การฝึกมีสามช่วง ได้แก่ การฝึกเพิ่มเติมด้านการให้เหตุผลสำหรับหุ่นยนต์ การปรับแต่งด้วยข้อมูลแบบมีคำตอบกำกับ และการเรียนรู้แบบเสริมกำลังผ่านการโต้ตอบ แนวทางนี้มุ่งปรับโมเดลภาพและภาษาพื้นฐานให้เหมาะกับการนำทาง สอนพฤติกรรมผ่านระบบโทเคนร่วม แล้วพัฒนานโยบายการเคลื่อนที่ต่อจากประสบการณ์ระหว่างฝึก 1
8
Light Origins รายงานอัตราความสำเร็จระดับแนวหน้าในการทดสอบนำทางด้วยภาพจากกล้องตัวเดียวบน 10 สภาพแวดล้อมจำลองสาธารณะ ครอบคลุมการทำตามคำสั่ง การไปหาวัตถุเป้าหมาย และการติดตามด้วยภาพ พร้อมรายงานความสามารถในการนำไปใช้กับหุ่นยนต์ต่างรูปแบบและฉากจริงแบบ zero-shot หรือโดยไม่ฝึกเพิ่มสำหรับกรณีนั้นก่อน ข้อมูลเหล่านี้เป็นผลประเมินที่ทีมรายงาน ไม่ได้พิสูจน์ว่าหุ่นยนต์ที่ไม่คุ้นเคยทุกตัวจะทำงานได้สำเร็จ หรือเลิกเก็บข้อมูลจากการบังคับโดยคนได้ทั้งหมด 7
8
13
ทีมเผยแพร่น้ำหนักโมเดล โค้ด รายงานทางเทคนิค และชุดประเมิน INSIGHT-Bench โดยระบุการเผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 ทำให้ผู้อื่นมีวัสดุสำหรับตรวจสอบและทดลองต่อ ประเด็นสำคัญของ LightNav-0 จึงไม่ใช่การตัดคนออกจากกระบวนการฝึกทันที แต่เป็นความเป็นไปได้ที่จะ ลด จำนวนตัวอย่างที่ต้องเก็บแยกตามหุ่นยนต์ โดยยังต้องตรวจสอบผลกับหุ่นยนต์และสถานที่ใช้งานจริงแต่ละกรณี 2
5
10
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
LightNav 0 รวมการทำตามคำสั่ง การไปหาเป้าหมายที่ระบุด้วยคำพูด และการติดตามเป้าหมายด้วยภาพไว้ในโมเดลเดียว [1][2]
LightNav 0 รวมการทำตามคำสั่ง การไปหาเป้าหมายที่ระบุด้วยคำพูด และการติดตามเป้าหมายด้วยภาพไว้ในโมเดลเดียว [1][2] ระบบแยก «จุดหมายที่ต้องการไป» ออกจาก «เส้นทางการเคลื่อนที่ของหุ่นยนต์แต่ละแบบ» เพื่อเอื้อให้ใช้สิ่งที่เรียนรู้ร่วมกันได้ [1][5]
Light Origins รายงานว่าใช้ฉากจากโลกจริงกว่า 2,000 ฉากสร้างประสบการณ์ฝึกในโลกจำลองกว่า 4,000 ชั่วโมง แต่ตัวเลขนี้ยังไม่ใช่หลักฐานว่าลดต้นทุนเก็บข้อมูลจริงได้เท่าไร [8]