Qwen Drive 1.0 4B는 Qwen3.5 4B를 공통 비전·언어 백본으로 유지하고, BEV 3D 인지 헤드와 궤적 계획 모듈을 별도로 연결한 Apache 2.0 공개 모델이다. 계획 모듈은 지도학습 기반 planner sft와 보상 최적화를 거친 planner rl로 나뉘며, VQA·직접 계획·추론 조건부 계획의 세 가지 실행 방식을 제공한다.
게시자GPT-5.6 Terra로 편집GPT Image 2로 이미지 생성
연구 답변

Create a landscape editorial hero image for this Studio Global article: What is Alibaba Qwen’s Qwen-Drive-1.0-4B, released on September 8, 2026, and how does its Apache 2.0 open-source design combine the unchange. Article summary: Qwen-Drive-1.0-4B is Qwen’s Apache-2.0 open-weight, 4B-parameter vision-language driving model, developed with Huazhong University of Science and Technology. It keeps Qwen3.5-4B’s multimodal VLM architecture intact and a. Topic tags: general, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, clic
알리바바 Qwen과 화중과학기술대가 개발한 Qwen-Drive-1.0-4B는 자율주행 연구용 오픈 웨이트 비전·언어 모델(VLM)이다. 핵심은 기존 Qwen3.5-4B를 불투명한 종단간 주행 스택으로 다시 학습시키는 대신, 공통 멀티모달 백본은 유지하고 BEV(조감도) 3D 인지와 운동 계획 기능을 외부 모듈로 붙였다는 점이다. 가중치와 관련 소프트웨어는 Apache 2.0 라이선스로 공개됐다. 10
11
15
공통 백본인 Qwen3.5-4B는 이미지와 언어를 처리한다. 주행 장면에 관한 시각 질의응답(VQA)을 수행하는 한편, 추가 주행 모듈이 사용할 표현도 제공한다. Qwen이 밝힌 설계 목표는 범용 멀티모달 아키텍처를 교체하지 않고 주행 능력을 덧붙이는 것이다. 10
11
여기에 두 개의 외부 모듈이 연결된다.
이 분리는 연구 측면에서 특히 유용하다. 연구팀은 인지와 계획을 따로 검증하거나, 직접 계획과 언어 추론을 거친 계획을 비교하고, 핵심 VLM을 바꾸지 않은 채 각 모듈을 교체·제거하는 절제 실험(ablation)을 수행할 수 있다.
planner-sft와 planner-rl의 차이Qwen은 같은 백본을 중심으로 두 가지 계획 모델을 공개했다.
planner-sft**는 지도학습·모방학습으로 훈련한 Planning Expert다. 모델이 텍스트 근거를 생성하기 전후 모두에서 궤적을 만들 수 있다. planner-rl**은 벤치마크 지향 목표에 대한 보상 기반 훈련을 추가로 적용한 버전이다. 최적화 롤아웃이 샘플링된 추론문에 조건화돼 있었기 때문에, 프로젝트 문서는 이 모델을 추론 조건부 계획에서 사용할 것을 권장한다. 여기서 평가 지표의 성격 차이를 구분할 필요가 있다. 보상 최적화는 선호 정렬 또는 의사 폐루프(pseudo-closed-loop) 성격의 점수를 개선하는 대신, 기록된 사람 운전 궤적과의 개방 루프 변위 오차는 소폭 악화시킬 수 있다. 궤적 오차가 더 낮다고 해서 선호도나 폐루프 성능까지 자동으로 더 좋다는 뜻은 아니다. 1
공개 쿠크북은 다음 세 가지 추론 모드를 설명한다. 17
| 모드 | 실행 구성 | 출력 |
|---|---|---|
VQA |
VLM만 실행 | 텍스트 답변 |
DIRECT_PLANNING |
VLM 1회 실행 후 Planning Expert 실행 | 궤적 |
REASONING_PLANNING |
VLM이 근거를 작성한 뒤, Expert가 그 문맥을 사용 | 근거와 궤적 |
세 모드는 동일한 기반 네트워크를 사용한다. 차이는 근거 텍스트를 생성하는지, 그리고 계획기가 그 생성 문맥을 포함한 표현을 읽는지에 있다. 17
Qwen은 주행 특화 3D 인지, 주행 VQA, 계획 감독을 범용 비전·언어 데이터와 결합하는 단계적 학습 전략을 설명한다. 데이터 파이프라인은 서로 다른 인지 라벨을 공통 분류 체계로 매핑하고, 일관성을 위해 주행 VQA 답변을 다듬으며, 공개 데이터셋의 궤적을 공통 웨이포인트 형식으로 변환한다. 1
11
의도는 전문화와 보존의 균형이다. 즉, 주행 장면 이해와 계획 능력을 얻되, 기본 VLM의 범용 이미지·언어 능력을 단순히 잃지 않도록 설계했다. 다만 공개 자료는 이것이 설계·평가 목표였음을 뒷받침할 뿐, 모든 일반지식 또는 공간 이해 벤치마크에서의 포괄적이고 독립적인 성능을 입증하는 자료는 아니다. 1
11
Qwen이 보고한 계획 결과에서 RL 계획기는 NAVSIM v1.1의 PDMS가 90.7로, SFT의 88.2보다 높았다. 6개 샘플 중 최선값을 택하는 방식에서는 각각 91.4와 89.3이었다. Waymo Open Dataset 종단간 평가의 RFS는 RL 7.91, SFT 7.78로 보고됐다. NVIDIA PhysicalAI 개방 루프 평가의 3초 minADE는 RL 0.38m, SFT 0.34m였다. 1
저장소는 LingoQA, VLAD, SURDS, WaymoQA, DriveLM 계열 지표 등 여러 주행 VQA 벤치마크에서, 열거된 Qwen3.5-4B 기준선보다 개선된 결과도 제시한다. 1
하지만 이는 어디까지나 프로젝트 측이 보고한 벤치마크 결과다. 안전성 인증이나 실제 도로 배치 준비 상태를 독립적으로 증명하는 결과는 아니다. 계획 점수, 기록 궤적과의 개방 루프 유사도, 선호 기반 지표, 실제 환경 안전성 검증은 서로 다른 주장이다. Qwen 역시 이번 공개를 상용 자율주행 시스템이 아니라 초기 단계의 연구 지향 프로젝트로 규정한다. 5
11
Hugging Face 모델 저장소에는 Qwen-Drive-1.0-4B의 가중치와 설정이 제공된다. 코드베이스, 데모 데이터, 문서는 공개 GitHub 저장소 QwenLM/Qwen-Drive-1.0에서 안내한다. 10
12
GitHub 프로젝트에는 모듈형 추론과 평가 자료가 포함돼 있다. 개발자는 다음 작업을 시도할 수 있다.
다만 이 공개만으로 전체 학습 과정을 재현할 수는 없다. 비공개 학습 코퍼스, 주석, 선호 라벨, 독점 데이터는 공개 가중치와 코드만으로 복원할 수 있는 범위 밖에 있다. 1
5
Qwen-Drive-1.0-4B의 가치는 40억 파라미터 모델 하나가 자율주행을 해결했다는 주장보다는, 언어·시각 이해, 3D 인지, 계획의 경계를 명시적으로 드러낸 연구 플랫폼이라는 데 있다. 이를 통해 어떤 변경이 장면 표현, 궤적 생성, 언어 추론, 혹은 특정 벤치마크의 보상 목표 중 어디에 영향을 줬는지 더 분명하게 분석할 수 있다.
또한 교체 가능한 헤드, 직접 구성한 장면, 대안적 카메라·센서 배치 등으로 확장할 여지도 남겨뒀다. 따라서 이 프로젝트는 해석 가능한 주행 구성요소를 공통 VLM으로 뒷받침하는 방법을 검증하기 위한 공개 출발점으로 보는 편이 적절하다. 11
18
Studio Global AI
이 페이지에는 Studio Global 내에서 계속할 수 있는 소스 기반 답변이 포함되어 있습니다.
Qwen Drive 1.0 4B는 Qwen3.5 4B를 공통 비전·언어 백본으로 유지하고, BEV 3D 인지 헤드와 궤적 계획 모듈을 별도로 연결한 Apache 2.0 공개 모델이다.
Qwen Drive 1.0 4B는 Qwen3.5 4B를 공통 비전·언어 백본으로 유지하고, BEV 3D 인지 헤드와 궤적 계획 모듈을 별도로 연결한 Apache 2.0 공개 모델이다. 계획 모듈은 지도학습 기반 planner sft와 보상 최적화를 거친 planner rl로 나뉘며, VQA·직접 계획·추론 조건부 계획의 세 가지 실행 방식을 제공한다.
공개된 가중치와 코드로 추론, 데모, 인지 출력, 일부 평가 작업은 실행할 수 있지만 비공개 학습 데이터·주석·선호 라벨까지 완전히 재현할 수 있는 것은 아니다.