TL;DR
Qwen-Drive-1.0은 pretrained Qwen3.5 vision-language model의 구조를 유지하면서 3D 인식, 주행 질의응답, 모션 계획을 하나의 자율주행용 프레임워크에 결합한 모델입니다. 공유 VLM으로 Qwen3.5-4B를 사용하고, BEV Perception Head가 3D 객체 검출·semantic occupancy·BEV 지도 분할을 수행하며, Planning Expert가 공유 표현에서 미래 차량 궤적을 생성합니다. 단계적 학습과 통합 데이터 파이프라인으로 주행 특화 감독 신호와 일반 vision-language 데이터를 함께 처리한 결과, Qwen-Drive-1.0-SFT는 NAVSIM v1.1에서 PDMS 88.2, Waymo Open Dataset에서 RFS 7.78, NVIDIA PhysicalAI open-loop 평가에서 3초 minADE 0.34m를 기록했습니다. 모델은 Hugging Face와 ModelScope에서 내려받을 수 있고, 24GB 이상 GPU와 제공된 데모 데이터로 VQA·인식·계획 추론을 실행할 수 있습니다.
섹션별 상세


model = QwenDriveForPlanning.from_pretrained(
"Qwen-Drive-1.0-4B",
planner="Qwen-Drive-1.0-4B/planner-rl",
dtype=torch.bfloat16
)Qwen-Drive VLM에 reward-optimized Planning Expert를 연결해 계획 모델을 불러옵니다.


git clone qwen-drive && cd qwen-drive
# Any Python virtual environment works; conda is shown here
conda create -n qwen-drive python=3.10
conda activate qwen-drive
pip install -e. --no-build-isolation
# or: pip install -r requirements.txtPython 3.10 환경을 만들고 Qwen-Drive 저장소와 의존성을 설치합니다.
export PYTHONPATH=src python scripts/demo.py --model Qwen-Drive-1.0-4B --planner Qwen-Drive-1.0-4B/planner-rl \
--scenes data/demo/planning_scenes.jsonl --image-archive data/demo/frames.parquet \
--plot demo.png번들로 제공되는 주행 장면과 프레임을 사용해 계획 결과 요약 그림을 생성합니다.
result = model.run(InferenceMode.REASONING_PLANNING, scene=scene, num_samples=6)
print(result.reasoning)
print(result.trajectories.shape) # (6, 50, 3) -> (x, y, heading), 5 s at 10 Hz추론 기반 계획 모드에서 6개 궤적을 샘플링하고 reasoning과 궤적 텐서 크기를 출력합니다.
용어 해설
- BEV 인식 헤드(BEV Perception Head)
- — BEV Perception Head는 여러 카메라 영상을 차량 중심의 Bird’s-Eye View 공간으로 변환해 3D 객체 검출, semantic occupancy 예측, BEV 지도 분할을 수행하는 외부 모듈입니다. Qwen-Drive에서는 공유 VLM 표현에 접근해 3D 장면 정보를 별도로 읽을 수 있는 검사 지점을 형성합니다.
- 시맨틱 점유 예측(Semantic Occupancy)
- — Semantic Occupancy는 주행 공간을 3차원 격자 또는 점유 영역으로 나누고 각 위치의 의미적 상태를 예측하는 작업입니다. Qwen-Drive는 카메라 입력에서 차량 주변의 주행 가능 영역과 객체 관련 구조를 추정해 3D 장면 이해와 경로 계획에 필요한 공간 정보를 제공합니다.
- 모션 플래닝(Motion Planning)
- — Motion Planning은 현재 장면과 차량 상태를 바탕으로 차량이 앞으로 이동할 궤적을 생성하는 과정입니다. Qwen-Drive의 Planning Expert는 공유 VLM 표현과 현재 ego state를 입력으로 받아 여러 시점의 위치와 heading을 포함한 미래 ego trajectory를 출력합니다.
- 오픈 루프 평가(Open-loop Evaluation)
- — Open-loop Evaluation은 실제 차량의 다음 행동이 다시 모델 입력으로 반영되지 않는 고정 데이터셋 환경에서 예측 궤적을 정답과 비교하는 평가 방식입니다. Qwen-Drive는 NAVSIM, Waymo Open Dataset, NVIDIA PhysicalAI-AV의 오픈 루프 지표를 사용해 계획 성능을 측정합니다.
- Best-of-N 계획(Best-of-N Planning)
- — Best-of-N Planning은 하나의 장면에 대해 여러 개의 후보 궤적을 샘플링한 뒤 평가 기준에 가장 적합한 결과를 선택하는 방식입니다. Qwen-Drive의 데모 코드는 6개 후보를 생성하며, NAVSIM 결과도 일반 점수와 best-of-6 점수를 구분해 기록합니다.
기술
- Qwen-Drive-1.0
- Qwen3.5-4B
- Qwen-Plus
- PyTorch
- Python 3.10
- Hugging Face
- ModelScope
- FlashAttention 2
- Apache 2.0
활용 사례
- 3D 객체 검출과 자율주행 장면 인식
- Semantic Occupancy 예측
- BEV 지도 분할
- Driving VQA와 일반 VQA
- 미래 ego trajectory 생성
- 주행 계획 benchmark 평가
- 다중 시점 주행 영상 분석
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.