Qwen Drive 1.0 4B je otevřený model s vahami pod licencí Apache 2.0, postavený na multimodálním základu Qwen3.5 4B. Přidává samostatnou BEV komponentu pro 3D vnímání a modul Planning Expert pro generování trajektorií; k dispozici jsou varianty planner sft a planner rl.
PublikovalUpraveno pomocí GPT-5.6 TerraObrázky vytvořeny pomocí GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-Drive-1.0-4B, released on September 8, 2026, and how does its Apache 2.0 open-source design combine the unchange. Article summary: Qwen-Drive-1.0-4B is Qwen’s Apache-2.0 open-weight, 4B-parameter vision-language driving model, developed with Huazhong University of Science and Technology. It keeps Qwen3.5-4B’s multimodal VLM architecture intact and a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
Qwen-Drive-1.0-4B je vision-language model (VLM) Alibaba Qwen určený pro výzkum autonomního řízení, vyvinutý společně s Huazhong University of Science and Technology. Namísto přetrénování modelu Qwen3.5-4B do neprůhledného end-to-end systému zachovává společný multimodální základ a připojuje k němu externí moduly pro vnímání okolí z pohledu shora (BEV) a pro plánování pohybu. Váhy i doprovodný software jsou vydány pod licencí Apache 2.0. 10
11
15
Sdílený model Qwen3.5-4B zpracovává obraz i text. Umí odpovídat na otázky nad obrazem, včetně dotazů k dopravním scénám, a poskytuje reprezentace pro navazující jízdní komponenty. Cílem návrhu je rozšířit schopnosti pro řízení, aniž by bylo nutné nahradit obecnou multimodální architekturu základního modelu. 10
11
Systém rozšiřují dva externí moduly:
Toto rozdělení je podstatné hlavně pro výzkum. Lze samostatně zkoumat vnímání a plánování, porovnávat přímé plánování s plánováním podmíněným textovým odůvodněním nebo měnit jednotlivé moduly, aniž by se zasahovalo do jádra VLM.
planner-sft a planner-rlQwen nabízí dvě varianty plánovače nad stejným základem:
planner-sft je Planning Expert trénovaný supervidovaně, tedy imitací ukázkových jízd. Umí generovat trajektorie přímo i po vytvoření textového zdůvodnění modelem. planner-rl je dále optimalizován pomocí odměn vůči cílům zaměřeným na benchmarky. Dokumentace jej doporučuje používat v režimu plánování podmíněného odůvodněním, protože optimalizační průchody byly podmíněny vzorkovaným reasoningem. Rozdíl objasňuje důležitý kompromis ve vyhodnocení. Optimalizace podle odměny může zlepšit skóre souladu s preferencemi nebo metriky blízké simulaci uzavřené smyčky, a přitom mírně zhoršit chybu vůči zaznamenané lidské trajektorii v režimu open loop. Tyto metriky odpovídají na jiné otázky: nižší odchylka od zaznamenané trasy automaticky neznamená lepší výsledek v preferenčním či uzavřeném hodnocení. 1
Veřejný cookbook popisuje tři režimy inference: 17
| Režim | Co se spouští | Výstup |
|---|---|---|
VQA |
Pouze VLM | Textová odpověď |
DIRECT_PLANNING |
Jeden průchod VLM, poté Planning Expert | Trajektorie |
REASONING_PLANNING |
VLM nejprve vytvoří odůvodnění, expert pak pracuje i s tímto kontextem | Odůvodnění a trajektorie |
Všechny režimy používají stejnou síť. Liší se tím, zda vznikne textové odůvodnění a zda plánovač dostane reprezentace zahrnující tento vygenerovaný kontext. 17
Qwen popisuje vícestupňový trénink, který kombinuje 3D vnímání specifické pro řízení, VQA nad jízdními scénami a supervizi plánování s obecnými obrazově-textovými daty. Pipeline převádí různorodé štítky vnímání na společnou taxonomii, upravuje odpovědi ve driving VQA kvůli konzistenci a sjednocuje trajektorie z veřejných datasetů do společného formátu bodů trasy. 1
11
Záměrem je skloubit specializaci se zachováním obecných schopností: model by měl lépe rozumět dopravním scénám a plánovat pohyb, aniž by ztratil obecné obrazově-jazykové schopnosti základního VLM. Dostupné materiály ukazují, že šlo o cíl návrhu a vyhodnocení, samy o sobě však nedokládají nezávislé a úplné výsledky napříč všemi benchmarky obecných znalostí či prostorového uvažování. 1
11
Podle výsledků uváděných samotným projektem dosáhl RL plánovač v NAVSIM v1.1 skóre PDMS 90,7 oproti 88,2 u SFT plánovače. Při výběru nejlepšího ze šesti vzorků vzrostly hodnoty na 91,4, respektive 89,3. Pro end-to-end hodnocení ve Waymo Open Datasetu projekt uvádí RFS 7,91 pro RL a 7,78 pro SFT. V open-loop vyhodnocení NVIDIA PhysicalAI uvádí třísekundové minADE 0,38 m pro RL a 0,34 m pro SFT. 1
Repozitář také uvádí zlepšení VQA pro jízdní scénáře oproti uvedenému základu Qwen3.5-4B na několika oborových benchmarcích, včetně LingoQA, VLAD, SURDS, WaymoQA a metrik ve stylu DriveLM. 1
Jde však o výsledky reportované projektem, nikoli o nezávislou certifikaci bezpečnosti či připravenosti k nasazení. Plánovací skóre, podobnost se zaznamenanou trajektorií v open loop, preferenční metriky a ověření bezpečnosti v reálném provozu jsou odlišná tvrzení. Qwen vydání popisuje jako první krok orientovaný na výzkum, ne jako produkční systém autonomního řízení. 5
11
Repozitář modelu na Hugging Face hostuje váhy a konfigurace Qwen-Drive-1.0-4B. Na veřejný repozitář QwenLM/Qwen-Drive-1.0 na GitHubu odkazuje pro zdrojový kód, ukázková data a dokumentaci. 10
12
GitHub projekt obsahuje modulární materiály pro inference i vyhodnocení. Vývojáři mohou:
Samotné vydání ale neumožňuje zrekonstruovat celý trénink. Nezveřejněné tréninkové korpusy, anotace, preferenční štítky a proprietární data nelze z veřejných vah a kódu plně obnovit. 1
5
Největší přínos Qwen-Drive-1.0-4B spočívá v roli výzkumné platformy. Jasně vymezuje hranice mezi jazykově-obrazovým porozuměním, 3D vnímáním a plánováním. To může zpřesnit ablační studie: výzkumníci mohou rozlišit, zda změna zlepšila reprezentaci scény, tvorbu trajektorie, jazykové uvažování, nebo jen optimalizaci pro konkrétní benchmarkovou odměnu.
Projekt zároveň otevírá prostor pro výměnu a rozšiřování hlav, vytváření vlastních scén a alternativní uspořádání kamer či senzorů. Jeho hodnota tedy nespočívá v tvrzení, že model se 4 miliardami parametrů vyřešil autonomní řízení, ale v otevřeném základu pro ověřování, jak může sdílený VLM podporovat interpretovatelné komponenty pro řízení. 11
18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen Drive 1.0 4B je otevřený model s vahami pod licencí Apache 2.0, postavený na multimodálním základu Qwen3.5 4B.
Qwen Drive 1.0 4B je otevřený model s vahami pod licencí Apache 2.0, postavený na multimodálním základu Qwen3.5 4B. Přidává samostatnou BEV komponentu pro 3D vnímání a modul Planning Expert pro generování trajektorií; k dispozici jsou varianty planner sft a planner rl.
Zveřejněné výsledky jsou užitečné pro srovnávání ve výzkumu, ale nepředstavují nezávislé potvrzení bezpečnosti ani připravenosti k nasazení na veřejných komunikacích.