Qwen Drive 1.0 4B er en open weight model med 4 mia. parametre, udgivet under Apache 2.0 og baseret på Qwen3.5 4B. Modellen kombinerer en fælles vision sprogmodel med separate moduler til BEV baseret 3D perception og planlægning af bilens fremtidige bane.
Udgivet afRedigeret med GPT-5.6 TerraBilleder genereret med GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-Drive-1.0-4B, released on September 8, 2026, and how does its Apache 2.0 open-source design combine the unchange. Article summary: Qwen-Drive-1.0-4B is Qwen’s Apache-2.0 open-weight, 4B-parameter vision-language driving model, developed with Huazhong University of Science and Technology. It keeps Qwen3.5-4B’s multimodal VLM architecture intact and a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Qwen-Drive-1.0-4B er Alibaba Qwens open-weight-vision-sprogmodel til forskning i selvkørende kørsel, udviklet sammen med Huazhong University of Science and Technology. I stedet for at omskole den underliggende Qwen3.5-4B-model til en lukket ende-til-ende-løsning bevarer projektet den fælles multimodale kerne og tilføjer eksterne moduler til fugleperspektiv-perception (BEV) og bevægelsesplanlægning. Vægte og ledsagende software er udgivet under Apache 2.0. 10
11
15
Den fælles Qwen3.5-4B-model håndterer billeder og tekst. Den kan blandt andet besvare spørgsmål om visuelle scener og køresituationer, samtidig med at den leverer repræsentationer til de ekstra kørselsmoduler. Qwens erklærede mål er at tilføre kørefunktioner uden at erstatte basismodellens generelle multimodale arkitektur. 10
11
To eksterne moduler bygger videre på den:
Opdelingen er interessant i forskningssammenhæng. Man kan teste perception og planlægning hver for sig, sammenligne direkte planlægning med planlægning, der tager afsæt i en tekstlig begrundelse, eller udskifte og frakoble moduler uden at ændre selve VLM-kernen.
planner-sft og planner-rlQwen udgiver to planlægningsvarianter oven på samme backbone:
planner-sft er Planning Expert trænet med superviseret læring eller imitation. Den kan enten generere baner direkte eller gøre det, efter modellen først har skrevet en tekstlig begrundelse. planner-rl er yderligere optimeret med belønningsbaseret træning mod mål, der er rettet mod benchmarks. Projektets dokumentation anbefaler den til planlægning med begrundelse, fordi optimeringsforløbene var betinget af genererede begrundelser. Det forklarer en vigtig afvejning i evalueringen. Belønningsoptimering kan løfte scorer for præferenceoverensstemmelse eller pseudo-lukket-sløjfe-evaluering, men samtidig forringe den åbne sløjfes afstandsfejl en smule i forhold til en registreret menneskelig kørebane. Målene belyser forskellige ting: En lavere banefejl er ikke automatisk det samme som en bedre præference- eller lukket-sløjfe-score. 1
Den offentlige vejledning beskriver tre inferenstilstande: 17
| Tilstand | Hvad kører | Output |
|---|---|---|
VQA |
Kun VLM'en | Tekstsvar |
DIRECT_PLANNING |
Én VLM-kørsel efterfulgt af Planning Expert | Baner/trajectories |
REASONING_PLANNING |
VLM'en skriver en begrundelse, hvorefter eksperten bruger konteksten | Begrundelse og baner |
Tilstandene bruger det samme underliggende netværk. Forskellen er, om der genereres en begrundelse, og om planlæggeren modtager repræsentationer, der også indeholder den genererede kontekst. 17
Qwen beskriver en trindelt træning, der kombinerer kørespecifik 3D-perception, VQA om køresituationer og planlægningssupervision med generelle vision-sprogdata. Datapipelinen omsætter forskellige perceptionsmærkater til en fælles taksonomi, gennemgår svar på kørsels-VQA for ensartethed og konverterer baner fra offentlige datasæt til det fælles waypoint-format. 1
11
Tanken er at balancere specialisering og fastholdelse: Modellen skal lære at forstå køresituationer og planlægge, uden blot at miste basismodellens generelle evner med billeder og tekst. Det tilgængelige materiale dokumenterer, at dette var et mål for design og evaluering, men fastslår ikke i sig selv en dækkende, uafhængig præstation på alle benchmarks for almen viden eller rumlig forståelse. 1
11
Qwens rapporterede planlægningsresultater giver RL-planlæggeren en højere NAVSIM v1.1 PDMS-score end SFT-planlæggeren: 90,7 mod 88,2. Med udvælgelse blandt seks genererede forslag stiger tallene til henholdsvis 91,4 og 89,3. Projektet rapporterer desuden end-to-end-RFS på Waymo Open Dataset på 7,91 for RL og 7,78 for SFT. I NVIDIAs PhysicalAI-evaluering med åben sløjfe rapporteres en tresekunders minADE på 0,38 m for RL og 0,34 m for SFT. 1
Repositoryet rapporterer også forbedringer i kørsels-VQA i forhold til en angivet Qwen3.5-4B-baseline på flere kørselsorienterede benchmarks, herunder LingoQA, VLAD, SURDS, WaymoQA og DriveLM-lignende mål. 1
Det er projektets egne benchmarkresultater – ikke en uafhængig certificering af sikkerhed eller klarhed til brug på offentlig vej. Planlægningsscorer, lighed med loggede kørebaner i en åben sløjfe, præferencebaserede mål og validering af sikkerhed i den virkelige verden er forskellige påstande. Qwen beskriver selv udgivelsen som et første, forskningsorienteret skridt frem for et produktionsklart system til selvkørende biler. 5
11
Modelrepositoryet på Hugging Face indeholder Qwen-Drive-1.0-4B-vægte og konfigurationer og henviser til det offentlige repository QwenLM/Qwen-Drive-1.0 for kode, demo-data og dokumentation. 10
12
GitHub-projektet omfatter materialer til modulær inferens og evaluering. Udviklere kan blandt andet:
Udgivelsen gør det dog ikke muligt at genskabe hele træningen. Ikke-udgivne træningskorpora, annotationer, præferencemærkater og proprietære data kan ikke rekonstrueres alene ud fra de offentlige vægte og koden. 1
5
Qwen-Drive-1.0-4B er først og fremmest en forskningsplatform. Den gør grænserne mellem sprog- og synsforståelse, 3D-perception og planlægning tydelige. Det kan gøre ablationsstudier mere oplysende: Forskere kan undersøge, om en ændring forbedrer scenerepræsentationen, banegenereringen, den sproglige begrundelse eller et benchmark-specifikt belønningsmål.
Projektet åbner også for udvidelser som udskiftelige hoveder, brugerdefinerede scener og alternative kamera- eller sensoropsætninger. Værdien ligger derfor ikke i en påstand om, at en model med 4 mia. parametre løser selvkørende kørsel, men i et åbent udgangspunkt for at undersøge, hvordan en fælles vision-sprogmodel kan understøtte mere gennemskuelige kørselskomponenter. 11
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen Drive 1.0 4B er en open weight model med 4 mia. parametre, udgivet under Apache 2.0 og baseret på Qwen3.5 4B.
Qwen Drive 1.0 4B er en open weight model med 4 mia. parametre, udgivet under Apache 2.0 og baseret på Qwen3.5 4B. Modellen kombinerer en fælles vision sprogmodel med separate moduler til BEV baseret 3D perception og planlægning af bilens fremtidige bane.
Vægte findes på Hugging Face, mens kode, demo data, dokumentation og evalueringsværktøjer ligger i det offentlige GitHub projekt.