Qwen Drive 1.0 4B est un modèle vision langage à poids ouverts, sous licence Apache 2.0, bâti sur Qwen3.5 4B et conçu avec l’Université des sciences et technologies de Huazhong. Le socle multimodal est complété par une tête de perception BEV 3D et un expert de planification ; les variantes planner sft et planner rl...
Publié parModifié avec GPT-5.6 TerraImages générées avec GPT Image 2
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-Drive-1.0-4B, released on September 8, 2026, and how does its Apache 2.0 open-source design combine the unchange. Article summary: Qwen-Drive-1.0-4B is Qwen’s Apache-2.0 open-weight, 4B-parameter vision-language driving model, developed with Huazhong University of Science and Technology. It keeps Qwen3.5-4B’s multimodal VLM architecture intact and a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Qwen-Drive-1.0-4B est le modèle vision-langage à poids ouverts de l’équipe Qwen d’Alibaba pour la recherche en conduite autonome, développé avec l’Université des sciences et technologies de Huazhong. Au lieu de transformer Qwen3.5-4B en une pile de conduite de bout en bout difficile à inspecter, le projet conserve son socle multimodal et lui greffe des modules externes de perception à vue aérienne — ou BEV (bird’s-eye view) — et de planification du mouvement. Les poids et les logiciels associés sont publiés sous licence Apache 2.0. 10
11
15
Le modèle partagé Qwen3.5-4B traite les images et le langage. Il peut répondre à des questions visuelles, y compris sur des scènes de circulation, tout en fournissant les représentations utilisées par les composants dédiés à la conduite. L’objectif affiché est d’ajouter ces capacités sans remplacer l’architecture multimodale généraliste du modèle de base. 10
11
Deux modules externes le complètent :
Cette séparation est utile pour la recherche : il devient possible d’évaluer la perception indépendamment de la planification, de comparer une planification directe à une planification guidée par un raisonnement textuel, ou encore de remplacer un module sans modifier le cœur du VLM.
planner-sft et planner-rl : deux approches de la planificationQwen publie deux variantes de planification construites sur le même modèle de base :
planner-sft est l’expert entraîné par apprentissage supervisé, ou imitation. Il peut produire une trajectoire directement ou après la génération d’une justification textuelle par le modèle. planner-rl est ensuite optimisé par récompense selon des objectifs liés aux benchmarks. La documentation recommande de l’utiliser avec un raisonnement préalable, car ses trajectoires d’optimisation étaient conditionnées par des raisonnements échantillonnés. Cette différence éclaire un compromis important dans les évaluations. L’optimisation par récompense peut améliorer des scores d’alignement sur des préférences ou des métriques orientées pseudo-boucle fermée, tout en dégradant légèrement l’erreur de déplacement en boucle ouverte par rapport à une trajectoire humaine enregistrée. Ces métriques ne mesurent pas la même chose : une erreur de trajectoire plus faible ne signifie pas automatiquement un meilleur score de préférence ou de conduite en boucle fermée. 1
Le guide public décrit trois façons d’exécuter le modèle : 17
| Mode | Composants exécutés | Résultat |
|---|---|---|
VQA |
Le VLM seul | Réponse textuelle |
DIRECT_PLANNING |
Un passage du VLM, puis le Planning Expert | Trajectoires |
REASONING_PLANNING |
Le VLM produit un raisonnement, puis l’expert exploite ce contexte | Raisonnement et trajectoires |
Le réseau sous-jacent reste identique. Ce qui change est la génération éventuelle d’un raisonnement et le fait que le planificateur reçoive, ou non, des représentations incluant ce texte généré. 17
Qwen décrit un entraînement par étapes combinant supervision de perception 3D, questions-réponses visuelles sur la conduite et planification, avec des données vision-langage généralistes. Le pipeline ramène les étiquettes de perception issues de sources diverses vers une taxonomie commune, harmonise les réponses des jeux de données de VQA routière et convertit les trajectoires publiques dans le format partagé de points de passage. 1
11
La démarche vise à concilier spécialisation et préservation des capacités généralistes : le modèle doit progresser dans la compréhension des scènes routières et la planification sans abandonner les aptitudes image-langage de Qwen3.5-4B. Les éléments disponibles confirment qu’il s’agit d’un objectif de conception et d’évaluation ; ils ne suffisent toutefois pas à établir, de manière exhaustive et indépendante, les performances sur l’ensemble des benchmarks de connaissances générales ou de raisonnement spatial. 1
11
Selon les résultats publiés par le projet, la variante RL obtient un score NAVSIM v1.1 PDMS supérieur à celui de la variante SFT : 90,7 contre 88,2, ou 91,4 contre 89,3 avec un échantillonnage « best-of-six ». Sur le test de bout en bout du Waymo Open Dataset, les valeurs RFS annoncées sont de 7,91 pour RL et de 7,78 pour SFT. Dans l’évaluation en boucle ouverte NVIDIA PhysicalAI, le minADE à trois secondes est de 0,38 m pour RL et 0,34 m pour SFT. 1
Le dépôt fait également état de progrès en VQA appliquée à la conduite face à une référence Qwen3.5-4B sur plusieurs benchmarks, parmi lesquels LingoQA, VLAD, SURDS, WaymoQA et des mesures de type DriveLM. 1
Il s’agit de résultats rapportés par le projet, et non d’une certification indépendante de sécurité ou d’aptitude au déploiement. Les scores de planification, la ressemblance en boucle ouverte avec des trajectoires enregistrées, les métriques fondées sur les préférences et la validation de sécurité en conditions réelles correspondent à des affirmations différentes. Qwen présente lui-même cette publication comme une première étape tournée vers la recherche, pas comme un système de conduite autonome prêt pour la route. 5
11
Le dépôt Hugging Face héberge les poids et les configurations de Qwen-Drive-1.0-4B. Il renvoie vers le dépôt public GitHub QwenLM/Qwen-Drive-1.0, qui contient le code, les données de démonstration et la documentation. 10
12
Le projet GitHub fournit des outils modulaires d’inférence et d’évaluation. Les développeurs peuvent notamment :
La publication ne permet pas, à elle seule, de reproduire l’intégralité de l’entraînement. Les corpus non publiés, les annotations, les étiquettes de préférence et les données propriétaires ne peuvent pas être reconstitués à partir des seuls poids et du code accessibles publiquement. 1
5
L’intérêt principal de Qwen-Drive-1.0-4B est celui d’une plateforme de recherche : il rend explicites les frontières entre compréhension vision-langage, perception 3D et planification. Les études d’ablation peuvent donc aider à distinguer un gain dû à la représentation de scène, à la génération de trajectoires, au raisonnement linguistique ou à l’optimisation d’un objectif propre à un benchmark.
Le projet ouvre aussi la voie à des extensions : remplacement de têtes, construction de scènes sur mesure, ou adaptation à d’autres agencements de caméras et de capteurs. Sa valeur ne tient donc pas à l’idée qu’un modèle de 4 milliards de paramètres résoudrait la conduite autonome, mais à la mise à disposition d’un point de départ ouvert pour tester comment un VLM partagé peut alimenter des composants de conduite interprétables. 11
18
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Qwen Drive 1.0 4B est un modèle vision langage à poids ouverts, sous licence Apache 2.0, bâti sur Qwen3.5 4B et conçu avec l’Université des sciences et technologies de Huazhong.
Qwen Drive 1.0 4B est un modèle vision langage à poids ouverts, sous licence Apache 2.0, bâti sur Qwen3.5 4B et conçu avec l’Université des sciences et technologies de Huazhong. Le socle multimodal est complété par une tête de perception BEV 3D et un expert de planification ; les variantes planner sft et planner rl répondent à des logiques d’entraînement distinctes.
Les poids sont disponibles sur Hugging Face, tandis que GitHub rassemble le code d’inférence, les données de démonstration, la documentation et les outils d’évaluation.