Qwen Drive 1.0 4B è un modello vision language da 4 miliardi di parametri, con pesi aperti e licenza Apache 2.0, costruito sulla base Qwen3.5 4B. La piattaforma distingue il backbone multimodale dai moduli di percezione BEV e pianificazione; offre VQA, pianificazione diretta e pianificazione condizionata da ragionam...
Pubblicato daModificato con GPT-5.6 TerraImmagini generate con GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-Drive-1.0-4B, released on September 8, 2026, and how does its Apache 2.0 open-source design combine the unchange. Article summary: Qwen-Drive-1.0-4B is Qwen’s Apache-2.0 open-weight, 4B-parameter vision-language driving model, developed with Huazhong University of Science and Technology. It keeps Qwen3.5-4B’s multimodal VLM architecture intact and a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Qwen-Drive-1.0-4B è il modello vision-language a pesi aperti di Alibaba Qwen dedicato alla ricerca sulla guida autonoma, sviluppato insieme alla Huazhong University of Science and Technology. Invece di trasformare Qwen3.5-4B in uno stack di guida end-to-end opaco, il progetto conserva il backbone multimodale e collega moduli esterni per la percezione in vista dall’alto (bird’s-eye view, BEV) e per la pianificazione del movimento. Pesi e software sono rilasciati con licenza Apache 2.0. 10
11
15
Il modello condiviso Qwen3.5-4B elabora immagini e linguaggio. Può rispondere a domande visive, comprese quelle su una scena stradale, e fornisce le rappresentazioni utilizzate dai componenti aggiuntivi. L’obiettivo dichiarato è acquisire capacità di guida senza sostituire l’architettura multimodale generale del modello di base. 10
11
I due moduli esterni sono:
Per la ricerca, questa separazione è centrale: permette di analizzare percezione e pianificazione distintamente, confrontare una pianificazione diretta con una mediata dal ragionamento linguistico oppure sostituire e sottoporre ad ablation study i singoli moduli senza modificare il VLM di base.
planner-sft e planner-rl: cosa cambiaQwen pubblica due varianti del pianificatore, entrambe basate sul medesimo backbone:
planner-sft è il Planning Expert addestrato con supervisione, o imitazione di esempi di guida. Può produrre traiettorie direttamente oppure dopo che il modello ha generato una spiegazione testuale del proprio ragionamento. planner-rl riceve un’ulteriore ottimizzazione basata su ricompense, mirata a obiettivi di benchmark. La documentazione raccomanda di usarlo nella pianificazione condizionata da ragionamento, poiché i rollout di ottimizzazione erano condizionati su ragionamenti campionati. La differenza chiarisce un compromesso importante nelle valutazioni. L’ottimizzazione tramite ricompensa può migliorare metriche di allineamento alle preferenze o punteggi orientati a un ciclo chiuso simulato, peggiorando leggermente l’errore di spostamento in valutazione open-loop rispetto a una traiettoria umana registrata. Sono misure che rispondono a domande diverse: un errore di traiettoria più basso non equivale automaticamente a un migliore punteggio di preferenza o di ciclo chiuso. 1
Il cookbook pubblico descrive tre modalità operative: 17
| Modalità | Componenti eseguiti | Output |
|---|---|---|
VQA |
Solo VLM | Risposta testuale |
DIRECT_PLANNING |
Un passaggio del VLM, poi il Planning Expert | Traiettorie |
REASONING_PLANNING |
Il VLM formula prima un ragionamento, poi l’esperto usa quel contesto | Ragionamento e traiettorie |
La rete sottostante resta la stessa; a cambiare è se viene prodotto un ragionamento e se il pianificatore riceve rappresentazioni che incorporano quel contesto generato. 17
Qwen descrive un addestramento in più fasi che combina supervisione per percezione 3D, VQA per la guida e pianificazione con dati vision-language di uso generale. La pipeline riconduce etichette percettive eterogenee a una tassonomia condivisa, rivede le risposte di driving-VQA per renderle coerenti e converte le traiettorie dei dataset pubblici nel formato comune di waypoint. 1
11
L’intento è bilanciare specializzazione e conservazione delle capacità: il modello dovrebbe comprendere scene di guida e pianificare movimenti senza perdere semplicemente le abilità generali immagine-linguaggio di Qwen3.5-4B. I materiali disponibili confermano che questo era un obiettivo di progettazione e valutazione, ma non dimostrano da soli prestazioni indipendenti e complete su tutti i benchmark di conoscenza generale o spaziali. 1
11
Nei risultati di pianificazione riportati da Qwen, il pianificatore RL ottiene un PDMS di 90,7 su NAVSIM v1.1, contro 88,2 per SFT; con campionamento best-of-six, i valori salgono rispettivamente a 91,4 e 89,3. Sul test end-to-end del Waymo Open Dataset, il progetto riporta valori RFS pari a 7,91 per RL e 7,78 per SFT. Nella valutazione open-loop NVIDIA PhysicalAI, il minADE a tre secondi è 0,38 m per RL e 0,34 m per SFT. 1
Il repository segnala inoltre miglioramenti nel driving-VQA rispetto a una baseline Qwen3.5-4B elencata, su vari benchmark dedicati alla guida, tra cui LingoQA, VLAD, SURDS, WaymoQA e misure in stile DriveLM. 1
Si tratta però di risultati dichiarati dal progetto, non di una certificazione indipendente di sicurezza o idoneità all’impiego su strada. Punteggi di pianificazione, somiglianza open-loop con traiettorie registrate, metriche basate sulle preferenze e validazione della sicurezza nel mondo reale sono affermazioni distinte. La stessa Qwen presenta il rilascio come un primo passo orientato alla ricerca, non come un sistema di guida autonoma pronto per la produzione. 5
11
Il repository Hugging Face ospita pesi e configurazioni di Qwen-Drive-1.0-4B e rimanda al repository pubblico QwenLM/Qwen-Drive-1.0 per codice, dati demo e documentazione. 10
12
Il progetto GitHub include strumenti modulari per inferenza e valutazione. In pratica, gli sviluppatori possono:
Il rilascio non consente però di ricostruire ogni elemento dell’addestramento. Corpus non pubblicati, annotazioni, etichette di preferenza e dati proprietari restano fuori da ciò che può essere riprodotto usando soltanto pesi e codice disponibili pubblicamente. 1
5
Il valore principale di Qwen-Drive-1.0-4B è quello di piattaforma di ricerca: rende espliciti i confini tra comprensione visivo-linguistica, percezione 3D e pianificazione. Di conseguenza, gli esperimenti possono stabilire meglio se un cambiamento migliora la rappresentazione della scena, la generazione delle traiettorie, il ragionamento linguistico o semplicemente un obiettivo di ricompensa specifico di un benchmark.
Il progetto lascia inoltre spazio a estensioni: sostituzione delle teste, costruzione di scene personalizzate e configurazioni alternative di telecamere o sensori. Non sostiene che un modello da 4 miliardi di parametri risolva la guida autonoma; propone piuttosto una base aperta per verificare in che modo un VLM condiviso possa supportare componenti di guida più ispezionabili. 11
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen Drive 1.0 4B è un modello vision language da 4 miliardi di parametri, con pesi aperti e licenza Apache 2.0, costruito sulla base Qwen3.5 4B.
Qwen Drive 1.0 4B è un modello vision language da 4 miliardi di parametri, con pesi aperti e licenza Apache 2.0, costruito sulla base Qwen3.5 4B. La piattaforma distingue il backbone multimodale dai moduli di percezione BEV e pianificazione; offre VQA, pianificazione diretta e pianificazione condizionata da ragionamento.
Pesi e configurazioni sono su Hugging Face; codice, documentazione, dati demo e strumenti di valutazione sono nel repository GitHub pubblico di Qwen.