Qwen Drive 1.0 4B เป็นโมเดล vision language สำหรับงานวิจัยการขับขี่อัตโนมัติแบบโอเพนน้ำหนัก ภายใต้สัญญาอนุญาต Apache 2.0 และพัฒนาร่วมกับ Huazhong University of Science and Technology. ระบบคงแกน Qwen3.5 4B ไว้ แล้วเพิ่มหัวรับรู้มุมมองจากด้านบน (BEV) และ Planning Expert แยกกัน จึงทดสอบหรือสลับส่วนประกอบแต่ละส่วนได้ง่า...
เผยแพร่โดยแก้ไขด้วย GPT-5.6 Terraรูปภาพสร้างด้วย GPT Image 2
คำตอบการวิจัย

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-Drive-1.0-4B, released on September 8, 2026, and how does its Apache 2.0 open-source design combine the unchange. Article summary: Qwen-Drive-1.0-4B is Qwen’s Apache-2.0 open-weight, 4B-parameter vision-language driving model, developed with Huazhong University of Science and Technology. It keeps Qwen3.5-4B’s multimodal VLM architecture intact and a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Qwen-Drive-1.0-4B คือโมเดล vision-language (VLM) แบบโอเพนน้ำหนักของทีม Alibaba Qwen สำหรับงานวิจัยรถขับเคลื่อนอัตโนมัติ พัฒนาร่วมกับ Huazhong University of Science and Technology จุดเด่นไม่ได้อยู่ที่การฝึก Qwen3.5-4B ใหม่จนกลายเป็นระบบขับขี่แบบกล่องดำ แต่เป็นการคงแกนมัลติโหมดเดิมไว้ แล้วเชื่อมโมดูลภายนอกสำหรับการรับรู้แบบมุมมองจากด้านบนและการวางแผนการเคลื่อนที่ น้ำหนักและซอฟต์แวร์เผยแพร่ภายใต้ Apache 2.0 10
11
15
แกนร่วมของระบบคือ Qwen3.5-4B ซึ่งประมวลผลภาพและภาษา ใช้ตอบคำถามจากภาพ รวมถึงคำถามเกี่ยวกับสถานการณ์บนถนน และสร้างตัวแทนข้อมูลให้ส่วนขับขี่ที่ต่อเพิ่มเข้ามา เป้าหมายที่ Qwen ระบุคือ เพิ่มความสามารถด้านการขับขี่โดยไม่ต้องแทนที่สถาปัตยกรรมมัลติโหมดทั่วไปของโมเดลฐาน 10
11
โมดูลภายนอกมี 2 ส่วนหลัก
การแบ่งแบบนี้มีประโยชน์ต่อการวิจัย เพราะทีมพัฒนาสามารถวัดผลการรับรู้และการวางแผนแยกกัน เปรียบเทียบการวางแผนโดยตรงกับการวางแผนที่อาศัยเหตุผลเชิงภาษา หรือสลับและตัดทอนโมดูลเพื่อทดสอบผลได้ โดยไม่ต้องแก้แกน VLM ทั้งชุด
planner-sft กับ planner-rl ต่างกันอย่างไรQwen ปล่อยตัววางแผน 2 รุ่นที่ใช้แกนเดียวกัน
planner-sft คือ Planning Expert ที่ผ่านการฝึกแบบกำกับหรือเลียนแบบพฤติกรรม สามารถสร้างเส้นทางได้โดยตรง หรือสร้างหลังจากโมเดลเขียนคำอธิบายเหตุผลเป็นข้อความ planner-rl คือรุ่นที่นำไปปรับเพิ่มด้วยการฝึกจากรางวัล โดยใช้เป้าหมายที่ผูกกับเบนช์มาร์ก เอกสารแนะนำให้ใช้ในโหมดวางแผนที่มีเหตุผลประกอบ เพราะ rollout ระหว่างการปรับแต่งถูกกำหนดเงื่อนไขด้วยเหตุผลที่โมเดลสุ่มสร้าง ความต่างนี้อธิบายข้อแลกเปลี่ยนในการประเมินได้ชัดเจน การปรับด้วยรางวัลอาจเพิ่มคะแนนที่สะท้อนความสอดคล้องกับความชอบ หรือคะแนนแนว pseudo-closed-loop แต่ทำให้ค่าคลาดเคลื่อนของเส้นทางแบบ open-loop เมื่อเทียบกับเส้นทางมนุษย์ที่บันทึกไว้แย่ลงเล็กน้อย ตัวชี้วัดเหล่านี้ตอบคำถามคนละข้อ ดังนั้นความคลาดเคลื่อนของเส้นทางที่ต่ำกว่า ไม่ได้แปลว่าคะแนนด้านความชอบหรือ closed-loop จะดีกว่าเสมอไป 1
คู่มือของโครงการระบุโหมดอนุมานไว้ 3 แบบ 17
| โหมด | สิ่งที่ทำงาน | ผลลัพธ์ |
|---|---|---|
VQA |
VLM เท่านั้น | คำตอบข้อความ |
DIRECT_PLANNING |
VLM ทำงานหนึ่งรอบ แล้วตามด้วย Planning Expert | วิถีการเคลื่อนที่ |
REASONING_PLANNING |
VLM สร้างเหตุผลก่อน แล้ว Planning Expert ใช้บริบทนั้น | เหตุผลและวิถีการเคลื่อนที่ |
ทั้งสามโหมดใช้เครือข่ายพื้นฐานเดียวกัน แต่ต่างกันที่มีการสร้างคำอธิบายเหตุผลหรือไม่ และตัววางแผนจะได้รับตัวแทนข้อมูลที่รวมบริบทข้อความนั้นหรือไม่ 17
Qwen อธิบายการฝึกแบบเป็นลำดับขั้น ซึ่งผสานการกำกับดูแลงานรับรู้ 3 มิติ, VQA สำหรับสถานการณ์ขับขี่ และการวางแผน เข้ากับข้อมูล vision-language ทั่วไป กระบวนการนี้แมปป้ายกำกับการรับรู้จากหลายชุดข้อมูลเข้าสู่ taxonomy กลาง ปรับคำตอบ driving-VQA ให้สอดคล้องกัน และแปลงเส้นทางจากชุดข้อมูลสาธารณะเป็นรูปแบบ waypoint เดียวกัน 1
11
แนวทางนี้ตั้งใจสร้างสมดุลระหว่างการเชี่ยวชาญงานขับขี่กับการรักษาความสามารถเดิมของ VLM ในการเข้าใจภาพและภาษา หลักฐานที่มีสนับสนุนว่าเป็นเป้าหมายในการออกแบบและประเมินผล แต่ยังไม่เพียงพอจะยืนยันผลอิสระอย่างครอบคลุมในทุกเบนช์มาร์กความรู้ทั่วไปหรือการรับรู้เชิงพื้นที่ 1
11
ผลด้านการวางแผนที่ Qwen รายงานระบุว่า planner-rl ได้คะแนน NAVSIM v1.1 PDMS 90.7 สูงกว่า planner-sft ที่ 88.2 และเมื่อสุ่มเลือกผลลัพธ์ที่ดีที่สุดจาก 6 ครั้ง คะแนนเป็น 91.4 และ 89.3 ตามลำดับ โครงการยังรายงานค่า end-to-end RFS บน Waymo Open Dataset ที่ 7.91 สำหรับ RL และ 7.78 สำหรับ SFT บนการประเมิน open-loop ของ NVIDIA PhysicalAI ค่า minADE ระยะ 3 วินาทีอยู่ที่ 0.38 เมตรสำหรับ RL และ 0.34 เมตรสำหรับ SFT 1
คลังโค้ดยังรายงานว่าความสามารถ driving-VQA ดีขึ้นจาก baseline Qwen3.5-4B ที่ระบุไว้ ในหลายเบนช์มาร์ก เช่น LingoQA, VLAD, SURDS, WaymoQA และตัวชี้วัดแนว DriveLM 1
อย่างไรก็ดี นี่คือ ผลเบนช์มาร์กที่โครงการรายงานเอง ไม่ใช่การรับรองความปลอดภัยโดยหน่วยงานอิสระ หรือข้อพิสูจน์ว่าพร้อมนำไปใช้บนถนนจริง คะแนนวางแผน ความใกล้เคียงกับเส้นทางที่บันทึกไว้แบบ open-loop คะแนนจากความชอบ และการยืนยันความปลอดภัยในโลกจริง เป็นข้ออ้างคนละประเภทกัน Qwen เองวางตำแหน่งโครงการนี้เป็นก้าวเริ่มต้นเพื่อการวิจัย ไม่ใช่ระบบขับขี่อัตโนมัติระดับใช้งานจริง 5
11
Hugging Face โฮสต์น้ำหนักและคอนฟิกของ Qwen-Drive-1.0-4B และชี้ไปยังคลังสาธารณะ QwenLM/Qwen-Drive-1.0 สำหรับโค้ด ข้อมูลเดโม และเอกสาร 10
12
จาก GitHub นักพัฒนาสามารถใช้โครงสร้างแบบโมดูลาร์เพื่อ
แต่การปล่อยครั้งนี้ไม่ได้ทำให้ทำซ้ำกระบวนการฝึกได้ครบทุกส่วน ชุดข้อมูลฝึก ป้ายกำกับ ข้อมูลความชอบ และข้อมูลกรรมสิทธิ์ที่ไม่เผยแพร่ ยังคงไม่อาจสร้างกลับได้จากน้ำหนักและโค้ดสาธารณะเพียงอย่างเดียว 1
5
Qwen-Drive-1.0-4B มีประโยชน์ที่สุดในฐานะแพลตฟอร์มวิจัย เพราะมันทำให้เส้นแบ่งระหว่างความเข้าใจภาษาและภาพ การรับรู้ 3 มิติ และการวางแผน ปรากฏชัด นักวิจัยจึงพอแยกตรวจได้ว่า การเปลี่ยนแปลงหนึ่งช่วยยกระดับการแทนฉาก การสร้างเส้นทาง การให้เหตุผลด้วยภาษา หรือเพียงการทำคะแนนตามเป้าหมายรางวัลของเบนช์มาร์ก
โครงการยังเปิดทางให้เปลี่ยนหัวโมเดล สร้างฉากเอง และทดลองกับการจัดวางกล้องหรือเซ็นเซอร์รูปแบบอื่น คุณค่าของมันจึงไม่ใช่คำกล่าวอ้างว่าโมเดลขนาด 4B แก้ปัญหาการขับขี่อัตโนมัติได้แล้ว แต่คือจุดเริ่มต้นแบบเปิดสำหรับทดสอบว่า VLM แกนร่วมจะรองรับองค์ประกอบการขับขี่ที่ตรวจสอบและตีความได้อย่างไร 11
18
Studio Global AI
หน้านี้รวมคำตอบที่ได้รับการสนับสนุนจากแหล่งที่มาซึ่งคุณสามารถดำเนินการต่อภายใน Studio Global
Qwen Drive 1.0 4B เป็นโมเดล vision language สำหรับงานวิจัยการขับขี่อัตโนมัติแบบโอเพนน้ำหนัก ภายใต้สัญญาอนุญาต Apache 2.0 และพัฒนาร่วมกับ Huazhong University of Science and Technology.
Qwen Drive 1.0 4B เป็นโมเดล vision language สำหรับงานวิจัยการขับขี่อัตโนมัติแบบโอเพนน้ำหนัก ภายใต้สัญญาอนุญาต Apache 2.0 และพัฒนาร่วมกับ Huazhong University of Science and Technology. ระบบคงแกน Qwen3.5 4B ไว้ แล้วเพิ่มหัวรับรู้มุมมองจากด้านบน (BEV) และ Planning Expert แยกกัน จึงทดสอบหรือสลับส่วนประกอบแต่ละส่วนได้ง่ายกว่าแนวทางกล่องดำแบบ end to end.
มีน้ำหนักโมเดลบน Hugging Face และโค้ด เอกสาร ข้อมูลเดโม รวมถึงเครื่องมือประเมินบน GitHub แต่ผลเบนช์มาร์กที่โครงการรายงานไม่ใช่หลักฐานว่าพร้อมใช้งานบนถนนจริง.