HyWorldVLA ของ BYD ทำคะแนน 90.59 PDMS บน NAVSIM v1 ด้วยการผสานการกำกับดูแลระดับพิกเซลและการทำนายใน latent space ที่บีบอัดข้อมูลไว้ กระบวนการฝึกมี 3 ขั้น ได้แก่ ฝึก video VAE, pre train โมเดลโลกด้วยการกำกับดูแลทั้งพิกเซลและ latent และปรับแต่งร่วมกับโมเดลผู้เชี่ยวชาญด้านการกระทำเพื่อสร้างเส้นทาง เมื่อตัดการทำนายระดับพ...
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: How did BYD’s newly revealed AI team develop HyWorldVLA—a Vision-Language-Action autonomous-driving foundation model that combines pixel-lev. Article summary: BYD’s first public autonomous-driving foundation-model paper presents HyWorldVLA as a hybrid VLA system: it uses pixel-level reconstruction to preserve scene detail and latent-space prediction to make planning more robus. Topic tags: general, academic, general web, government, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermark
BYD เปิดตัว HyWorldVLA ในฐานะโมเดล Vision-Language-Action (VLA) สำหรับการขับขี่อัตโนมัติ ที่ใช้ “โมเดลโลก” แบบไฮบริด แนวคิดหลักคือให้ระบบเรียนรู้ภาพถนนในสองรูปแบบควบคู่กัน ได้แก่ การคาดการณ์ระดับพิกเซลซึ่งเก็บรายละเอียดของฉากได้มาก และ latent representation หรือข้อมูลแทนภาพแบบบีบอัด ซึ่งเหมาะกับการคาดการณ์และวางแผนเส้นทางอย่างมีประสิทธิภาพกว่า 1
การทำนายเฟรมในอนาคตระดับพิกเซลช่วยรักษารายละเอียดของสภาพแวดล้อมได้ดี แต่ใช้ทรัพยากรประมวลผลสูง ขณะที่โมเดลที่ทำงานใน latent space จะคาดการณ์จากตัวแทนข้อมูลที่ถูกบีบอัด จึงประหยัดกว่าในการใช้งานจริง แต่อาจทำให้รายละเอียดสำคัญต่อการขับขี่หลุดหายไป 1
HyWorldVLA เลือกไม่พึ่งแนวทางใดแนวทางหนึ่งเพียงอย่างเดียว ระหว่างการฝึก โมเดลใช้การกำกับดูแลระดับพิกเซลเพื่อยึด latent space ไว้กับภาพของโลกจริง แต่เมื่อใช้งาน ระบบจะทำนายเฉพาะ latent features แล้วส่งต่อให้ action expert หรือโมเดลเฉพาะทางด้านการกระทำ สร้างเส้นทางการขับขี่ 1
7
ขั้นแรกใช้ video variational autoencoder (VAE) บีบอัดลำดับวิดีโอการขับขี่ให้เป็น latent features โดยใช้ข้อมูลภาษาเป็นบริบทเชิงความหมายระหว่างฝึกตัวบีบอัด 2
5
เป้าหมายไม่ใช่แค่ลดขนาดข้อมูลวิดีโอ แต่คือทำให้ latent space เก็บสารสนเทศที่มีประโยชน์ต่อการทำนายเหตุการณ์ข้างหน้า และต่อการตัดสินใจขับรถในท้ายที่สุด
จากนั้น ระบบรวมภาพ การกระทำ ข้อมูลภาษา และ latent features ให้เป็นโทเค็นแบบไม่ต่อเนื่อง เพื่อทำนายโทเค็นถัดไปแบบ autoregressive ในขั้นนี้ โมเดลต้องทั้งทำนาย video latents ในอนาคต และสร้างเฟรมในอนาคตกลับขึ้นมาพร้อมกัน 1
2
นี่คือหัวใจของ การกำกับดูแลสองชั้น:
พูดให้เข้าใจง่าย การสูญเสียจากระดับพิกเซลทำหน้าที่คล้ายราวกันตก ไม่ให้ latent model บีบอัดฉากมากเกินไปจนทิ้งรายละเอียดที่จำเป็นต่อการขับขี่ 1
7
ในขั้นสุดท้าย BYD ปรับแต่งโมเดลโลกพร้อมกับโมเดลผู้เชี่ยวชาญที่สร้างการกระทำหรือเส้นทาง เมื่อใช้งานจริง ระบบจะทำนาย latent features แทนการสร้างเฟรมภาพเต็มระดับพิกเซล แล้วป้อนข้อมูลดังกล่าวให้ action expert เพื่อสร้าง trajectory หรือเส้นทางการขับรถ 1
การแยกบทบาทเช่นนี้มีความสำคัญต่อประสิทธิภาพ: โมเดลยังได้ประโยชน์จากการกำกับดูแลระดับพิกเซลที่ละเอียดในการฝึก แต่ไม่ต้องแบกรับต้นทุนการสร้างภาพระดับพิกเซลระหว่างการอนุมานแบบออนไลน์
บน NAVSIM v1 นั้น HyWorldVLA รายงานคะแนน 90.59 PDMS ซึ่งบทความวิจัยและรายงานที่เกี่ยวข้องระบุว่าเป็นผลลัพธ์ระดับแนวหน้าท่ามกลางผลที่เปิดเผยต่อสาธารณะในเวลานั้น 1
7
การทดสอบแบบ ablation หรือการตัดองค์ประกอบทีละส่วน ชี้ว่าความเป็นไฮบริดไม่ได้เป็นเพียงการใส่ฟีเจอร์เพิ่มเข้าไป:
ผลลัพธ์เหล่านี้สนับสนุนข้อเสนอของนักวิจัยว่า การกำกับดูแลระดับพิกเซลและการทำนาย latent แก้ปัญหาคนละด้าน: ส่วนแรกช่วยคงความเที่ยงตรงต่อฉาก ขณะที่ส่วนหลังทำให้การแทนข้อมูลมีประสิทธิภาพพอสำหรับการคาดการณ์การกระทำ
งานวิจัยทดสอบค่าน้ำหนักสองตัว ได้แก่ λ1 สำหรับ loss ของการทำนาย video tokens และ λ2 สำหรับความสอดคล้องของ latent representation 20
เมื่อกำหนด λ2 ไว้ที่ 0.1 การเพิ่ม λ1 จาก 0.1 เป็น 0.5 ทำให้ PDMS เพิ่มจาก 90.48 เป็น 90.59 แต่เมื่อเพิ่ม λ1 เป็น 1.0 คะแนนกลับลดลงเหลือ 89.83 20
เมื่อกำหนด λ1 ไว้ที่ 0.5 การเพิ่ม λ2 เกิน 0.1 ส่งผลให้ประสิทธิภาพลดลง: ที่ 0.2 คะแนน PDMS อยู่ที่ 90.47 และเมื่อเพิ่มต่อ คะแนนยังลดลงต่อเนื่อง 20 ข้อสรุปจึงไม่ใช่ว่า “ยิ่งกำกับดูแลมากยิ่งดี” แต่โมเดลต้องมีข้อจำกัดจากทั้งข้อมูลพิกเซลและ latent ในระดับพอดี เพื่อเก็บข้อมูลที่เป็นประโยชน์โดยไม่ทำให้ representation แข็งตัวเกินไป
PDMS เป็นคะแนนรวมที่ใช้ประเมินคุณภาพการขับขี่บน NAVSIM โดยคำนึงถึงปัจจัย เช่น การหลีกเลี่ยงการชนที่รถของระบบเป็นฝ่ายรับผิดชอบ การอยู่ในพื้นที่ที่ขับขี่ได้ ระยะเวลาจนเสี่ยงชน ความนุ่มนวลของการเคลื่อนที่ และความคืบหน้าของรถตามเส้นทาง 2
ดังนั้น คะแนน 90.59 ไม่ใช่คะแนนการจำแนกภาพธรรมดา แต่เป็นตัวชี้วัดผลการวางแผนขับขี่ภายใต้เงื่อนไขของ benchmark นี้ อย่างไรก็ดี NAVSIM ยังเป็นการประเมินในสภาพแวดล้อมจำลอง จึงไม่เท่ากับการยืนยันโดยอิสระว่าระบบปลอดภัยหรือทำงานได้ดีบนถนนจริง
บทความนี้ระบุสังกัดผู้วิจัยเป็น Automotive New Technology Research Institute ของ BYD และเป็นหลักฐานสาธารณะว่าบริษัทลงทุนกับงานวิจัย foundation model สำหรับการขับขี่อัตโนมัติภายในองค์กร 1 รายงานที่เชื่อมโยงทีมกับความเชี่ยวชาญด้านหุ่นยนต์ของ Harbin Institute of Technology น่าสนใจ แต่หลักฐานปฐมภูมิที่มีอยู่ยังไม่เพียงพอจะยืนยันภูมิหลังทางวิชาการของนักวิจัยแต่ละคน
5
เมื่อเทียบกับคู่แข่งอย่าง NIO, XPeng และ Li Auto งาน HyWorldVLA ทำให้ BYD มีผลงานวิจัย VLA และ world modeling ที่เปิดเผยต่อสาธารณะและวัดผลได้ สิ่งนี้แสดงถึงขีดความสามารถด้านวิจัย แต่ยังไม่ใช่ข้อพิสูจน์ว่า BYD นำหน้าคู่แข่งด้านการขับขี่อัตโนมัติบนถนนจริงแล้ว
ขนาดการผลิตและการนำรถออกสู่ตลาดของ BYD อาจกลายเป็นข้อได้เปรียบได้ ก็ต่อเมื่อบริษัทสามารถเปลี่ยนผลงานวิจัยให้เป็นผลิตภัณฑ์ที่ปลอดภัย ผ่านการตรวจสอบความถูกต้อง และนำไปใช้ได้อย่างมีประสิทธิภาพ การทดสอบสำคัญถัดไปจึงไม่ใช่เพียงคะแนน benchmark ครั้งใหม่ แต่คือการย้ายจากโมเดลและการจำลอง ไปสู่การใช้งานบนถนนที่เชื่อถือได้
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
HyWorldVLA ของ BYD ทำคะแนน 90.59 PDMS บน NAVSIM v1 ด้วยการผสานการกำกับดูแลระดับพิกเซลและการทำนายใน latent space ที่บีบอัดข้อมูลไว้
HyWorldVLA ของ BYD ทำคะแนน 90.59 PDMS บน NAVSIM v1 ด้วยการผสานการกำกับดูแลระดับพิกเซลและการทำนายใน latent space ที่บีบอัดข้อมูลไว้ กระบวนการฝึกมี 3 ขั้น ได้แก่ ฝึก video VAE, pre train โมเดลโลกด้วยการกำกับดูแลทั้งพิกเซลและ latent และปรับแต่งร่วมกับโมเดลผู้เชี่ยวชาญด้านการกระทำเพื่อสร้างเส้นทาง
เมื่อตัดการทำนายระดับพิกเซลออก คะแนน PDMS ลดเหลือ 87.50 ขณะที่ตัดการประมวลผล latent space ออก คะแนนลดเหลือ 89.91 สะท้อนว่าทั้งสองส่วนทำหน้าที่เสริมกัน