Qwen Drive 1.0 4B ialah model visi bahasa pemanduan berwajaran terbuka berasaskan Qwen3.5 4B, dibangunkan bersama Huazhong University of Science and Technology dan dilesenkan di bawah Apache 2.0. Seni binanya memisahkan pemahaman visi bahasa daripada persepsi BEV 3D dan perancangan trajektori, membolehkan penyelidik...
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-Drive-1.0-4B, released on September 8, 2026, and how does its Apache 2.0 open-source design combine the unchange. Article summary: Qwen-Drive-1.0-4B is Qwen’s Apache-2.0 open-weight, 4B-parameter vision-language driving model, developed with Huazhong University of Science and Technology. It keeps Qwen3.5-4B’s multimodal VLM architecture intact and a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Qwen-Drive-1.0-4B ialah model visi-bahasa (VLM) berwajaran terbuka daripada pasukan Qwen Alibaba, dibangunkan bersama Huazhong University of Science and Technology untuk penyelidikan pemanduan autonomi. Berbanding melatih semula Qwen3.5-4B menjadi sistem pemanduan hujung ke hujung yang sukar diperiksa, projek ini mengekalkan tulang belakang multimodal tersebut dan menambah modul luaran bagi persepsi bird’s-eye view (BEV) serta perancangan gerakan. Pemberat dan perisian iringan dikeluarkan di bawah lesen Apache 2.0. 10
11
15
Model Qwen3.5-4B yang dikongsi mengendalikan imej dan bahasa. Ia boleh menjawab soalan visual, termasuk soalan tentang situasi pemanduan, sambil menyediakan representasi kepada komponen pemanduan tambahan. Matlamat reka bentuk yang dinyatakan Qwen ialah menambah keupayaan pemanduan tanpa menggantikan seni bina multimodal am model asas. 10
11
Dua modul luaran meluaskan keupayaannya:
Pembahagian ini berguna untuk kerja penyelidikan. Pasukan boleh menguji persepsi dan perancangan secara berasingan, membandingkan perancangan terus dengan perancangan yang dipandu penaakulan bahasa, atau menukar dan menjalankan ablasi pada modul tanpa mengubah VLM teras.
planner-sft dan planner-rlQwen menyediakan dua varian perancangan yang menggunakan tulang belakang sama:
planner-sft ialah Planning Expert yang dilatih secara terselia atau imitasi. Ia boleh menjana trajektori secara langsung, atau selepas model menghasilkan rasional dalam bentuk teks. planner-rl pula dioptimumkan lanjut melalui latihan berasaskan ganjaran terhadap objektif penanda aras. Dokumentasi projek mengesyorkan mod perancangan berasaskan penaakulan kerana pelaksanaan pengoptimumannya dikondisikan pada penaakulan yang disampel. Perbezaan itu menerangkan satu pertukaran penting dalam penilaian. Pengoptimuman ganjaran boleh meningkatkan skor penjajaran keutamaan atau metrik berorientasikan gelung tertutup pseudo, tetapi sedikit memburukkan ralat sesaran gelung terbuka berbanding trajektori manusia yang direkodkan. Kedua-dua ukuran itu menjawab soalan berbeza; ralat trajektori lebih rendah tidak semestinya bermaksud skor keutamaan atau gelung tertutup lebih baik. 1
Dokumentasi awam menerangkan tiga mod inferens: 17
| Mod | Komponen yang berjalan | Output |
|---|---|---|
VQA |
VLM sahaja | Jawapan teks |
DIRECT_PLANNING |
Satu laluan VLM, kemudian Planning Expert | Trajektori |
REASONING_PLANNING |
VLM menghasilkan rasional, kemudian pakar menggunakan konteks itu | Penaakulan dan trajektori |
Ketiga-tiganya menggunakan rangkaian asas yang sama. Perbezaannya ialah sama ada rasional dijana, dan sama ada perancang menerima representasi yang turut mengandungi konteks teks terjana itu. 17
Qwen menerangkan strategi latihan berperingkat yang menggabungkan penyeliaan persepsi 3D khusus pemanduan, VQA pemanduan dan perancangan dengan data visi-bahasa kegunaan umum. Saluran datanya memetakan label persepsi yang tidak seragam kepada taksonomi bersama, menyemak semula jawapan VQA pemanduan agar konsisten, dan menukar trajektori daripada set data awam kepada format titik laluan yang sama. 1
11
Pendekatan ini bertujuan mengimbangi pengkhususan dengan pengekalan keupayaan asal: model sepatutnya memperoleh pemahaman situasi pemanduan dan kebolehan merancang tanpa mengorbankan kebolehan imej-bahasa umum VLM asas. Bahan yang tersedia menyokong bahawa perkara ini ialah matlamat reka bentuk dan penilaian, tetapi tidak membuktikan prestasi bebas yang menyeluruh bagi semua penanda aras pengetahuan umum atau ruang. 1
11
Keputusan perancangan yang dilaporkan Qwen menunjukkan skor NAVSIM v1.1 PDMS lebih tinggi untuk perancang RL berbanding SFT: 90.7 berbanding 88.2. Dengan pensampelan terbaik daripada enam percubaan, skornya meningkat kepada 91.4 dan 89.3. Projek itu turut melaporkan nilai RFS hujung ke hujung Waymo Open Dataset sebanyak 7.91 untuk RL dan 7.78 untuk SFT. Dalam penilaian gelung terbuka NVIDIA PhysicalAI, minADE tiga saat dilaporkan 0.38 m untuk RL dan 0.34 m untuk SFT. 1
Repositori itu juga melaporkan peningkatan VQA pemanduan berbanding garis asas Qwen3.5-4B yang disenaraikan pada beberapa penanda aras berorientasikan pemanduan, termasuk LingoQA, VLAD, SURDS, WaymoQA dan ukuran gaya DriveLM. 1
Namun, ini ialah keputusan penanda aras yang dilaporkan oleh projek, bukannya pensijilan bebas bahawa sistem ini selamat atau sedia digunakan di jalan raya. Skor perancangan, kesamaan gelung terbuka dengan trajektori yang direkodkan, metrik keutamaan dan pengesahan keselamatan dunia sebenar ialah tuntutan yang berlainan. Qwen sendiri meletakkan keluaran ini sebagai langkah awal berorientasikan penyelidikan, bukan sistem pemanduan autonomi untuk pengeluaran. 5
11
Repositori model Hugging Face menempatkan pemberat dan konfigurasi Qwen-Drive-1.0-4B, serta mengarahkan pengguna ke repositori awam QwenLM/Qwen-Drive-1.0 untuk pangkalan kod, data demo dan dokumentasi. 10
12
Melalui bahan modular itu, pembangun boleh:
Keluaran ini tidak dengan sendirinya membolehkan semua bahagian latihan dihasilkan semula. Korpus latihan, anotasi, label keutamaan dan data proprietari yang tidak dikeluarkan tidak boleh dibina semula hanya daripada pemberat dan kod awam. 1
5
Nilai utama Qwen-Drive-1.0-4B ialah sebagai platform penyelidikan yang menjadikan sempadan antara pemahaman bahasa-dan-visi, persepsi 3D dan perancangan lebih jelas. Ini boleh menjadikan eksperimen ablasi lebih bermakna: penyelidik boleh mengasingkan sama ada perubahan meningkatkan representasi situasi, penjanaan trajektori, penaakulan bahasa atau objektif ganjaran khusus penanda aras.
Projek ini juga membuka ruang untuk kepala pengganti, pembinaan situasi tersuai serta susun atur kamera atau sensor alternatif. Jadi, sumbangan utamanya bukan dakwaan bahawa model 4B telah menyelesaikan pemanduan autonomi, tetapi titik permulaan terbuka untuk menguji cara VLM bersama boleh menyokong komponen pemanduan yang lebih mudah diperiksa. 11
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen Drive 1.0 4B ialah model visi bahasa pemanduan berwajaran terbuka berasaskan Qwen3.5 4B, dibangunkan bersama Huazhong University of Science and Technology dan dilesenkan di bawah Apache 2.0.
Qwen Drive 1.0 4B ialah model visi bahasa pemanduan berwajaran terbuka berasaskan Qwen3.5 4B, dibangunkan bersama Huazhong University of Science and Technology dan dilesenkan di bawah Apache 2.0. Seni binanya memisahkan pemahaman visi bahasa daripada persepsi BEV 3D dan perancangan trajektori, membolehkan penyelidik menguji atau menukar modul secara berasingan.
Pemberat tersedia di Hugging Face, manakala kod inferens, data demo, dokumentasi dan bahan penilaian disediakan dalam repositori GitHub awam.