본문으로 건너뛰기

Qwen-Drive-1.0의 자율주행 통합 모델

Qwen-Drive-1.0이 Qwen3.5-4B에 3D 인식과 궤적 계획 헤드를 결합했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Qwen-Drive-1.0은 pretrained Qwen3.5 vision-language model의 구조를 유지하면서 3D 인식, 주행 질의응답, 모션 계획을 하나의 자율주행용 프레임워크에 결합한 모델입니다. 공유 VLM으로 Qwen3.5-4B를 사용하고, BEV Perception Head가 3D 객체 검출·semantic occupancy·BEV 지도 분할을 수행하며, Planning Expert가 공유 표현에서 미래 차량 궤적을 생성합니다. 단계적 학습과 통합 데이터 파이프라인으로 주행 특화 감독 신호와 일반 vision-language 데이터를 함께 처리한 결과, Qwen-Drive-1.0-SFT는 NAVSIM v1.1에서 PDMS 88.2, Waymo Open Dataset에서 RFS 7.78, NVIDIA PhysicalAI open-loop 평가에서 3초 minADE 0.34m를 기록했습니다. 모델은 Hugging Face와 ModelScope에서 내려받을 수 있고, 24GB 이상 GPU와 제공된 데모 데이터로 VQA·인식·계획 추론을 실행할 수 있습니다.

섹션별 상세

01
Qwen-Drive-1.0은 pretrained Qwen3.5 vision-language model의 원래 구조와 LLM Decoder를 유지하면서 자율주행 작업을 확장한 통합 모델입니다. 공유 VLM인 Qwen3.5-4B가 일반 VQA와 Driving VQA를 처리하고, 외부 모듈이 같은 표현을 이용해 3D 장면 인식과 미래 주행 궤적 생성을 수행합니다. 하나의 VLM을 여러 작업에 공유하는 구조로 일반 시각 이해와 주행 특화 능력을 함께 유지하려는 설계입니다.
02
BEV Perception Head는 여러 카메라 관측을 차량 중심 BEV 표현으로 연결하고 3D object detection, semantic occupancy prediction, BEV map segmentation을 공동 수행합니다. 이 헤드는 공유 표현에서 접근 가능한 3D 정보를 별도로 읽는 명시적 인터페이스가 되며, 검출 상자와 점유 구조, 차선·도로 지도 정보를 출력합니다. 제공된 인식 결과 그림은 여러 시점 영상과 BEV 예측을 정답 장면 및 지도 분할과 나란히 비교합니다.
주행 영상과 일반 이미지를 Qwen3.5 Language Model에 입력하고 BEV Perception Head, VQA, Planning Expert로 연결하는 Qwen-Drive 통합 아키텍처입니다.
Diagram다이어그램은 Vision Encoder가 여러 시점의 관측 이미지를 처리하고 Qwen3.5 Language Model이 공유 표현을 생성하는 흐름을 나타냅니다. 공유 표현은 BEV Perception Head를 통해 3D detection·occupancy·map segmentation으로, Planning Expert를 통해 clean trajectory로 이어지며, VQA는 원래 LLM Decoder를 사용합니다. 본문이 설명한 인식·질의응답·계획의 통합 구조와 각 외부 헤드의 역할을 직접 연결합니다.
여러 주행 장면에서 3D 객체 검출, BEV 시점, semantic occupancy 예측, 지도 분할 결과와 정답을 비교한 인식 결과입니다.
Diagram이미지는 multi-view 입력 영상의 객체에 예측 상자를 표시하고, 같은 장면의 BEV-view·semantic occupancy·map segmentation 예측을 ground truth와 비교합니다. 차량·보행자·자전거·장애물과 주행 가능 영역, 차선 및 도로 경계가 서로 다른 색으로 구분되어 3D 장면 구조 추정 결과를 확인할 수 있습니다. 이는 BEV Perception Head가 세 가지 인식 작업을 공동 수행한다는 본문 설명과 직접 연결됩니다.
03
Planning Expert는 공유 VLM 표현과 시간에 따른 ego state를 조건으로 미래 ego trajectories를 생성합니다. SFT 버전은 imitation training으로 학습하고, RL 버전은 benchmark objective에 대한 reward optimization을 거친 동일한 전문가 모듈이며 두 버전 모두 하나의 VLM을 공유합니다. 추론 예시에서 모델은 6개 후보를 샘플링하고 각 궤적을 5초 동안 10Hz로 표현해 위치 x·y와 heading을 포함한 (6, 50, 3) 텐서로 반환합니다.
04
학습 과정은 perception, language, planning objective를 단계적으로 결합하고 서로 다른 주행 데이터의 감독 형식을 하나로 정리합니다. 데이터 파이프라인은 이질적인 perception annotation을 공통 label space로 매핑하고, driving VQA 응답을 형식·사실 일관성에 맞게 재주석하며, 여러 공개 데이터셋의 trajectory를 통합 waypoint 표현으로 변환합니다. 이 처리 덕분에 주행 데이터의 전문성과 일반 vision-language 데이터의 폭넓은 지시 수행 능력을 같은 학습 체계에서 다룹니다.
05
계획 평가에서 Qwen-Drive-1.0-SFT는 NAVSIM v1.1 navtest에서 PDMS 88.2를 기록했고 best-of-6은 89.3이었습니다. Waymo Open Dataset E2E test에서는 RFS 7.78, NVIDIA PhysicalAI open-loop 평가에서는 3초 minADE 0.34m를 얻었으며, RL 버전은 각각 90.7, 7.91, 0.38m로 기록됐습니다. 이러한 수치는 고정 주행 장면에서 정답 궤적과 비교한 결과이며 실제 폐루프 차량 운행 성능과는 평가 조건이 다릅니다.
python
model = QwenDriveForPlanning.from_pretrained(
    "Qwen-Drive-1.0-4B",
    planner="Qwen-Drive-1.0-4B/planner-rl",
    dtype=torch.bfloat16
)

Qwen-Drive VLM에 reward-optimized Planning Expert를 연결해 계획 모델을 불러옵니다.

Qwen-Drive-1.0과 비교 모델의 Driving VQA, 일반 VQA, 3D 인식, 모션 계획 benchmark 점수를 방사형 막대그래프로 비교한 이미지입니다.
Chart이미지는 Qwen-Drive-1.0이 Driving VQA와 일반 VQA, 3D perception, motion planning 여러 지표에서 비교 모델과 어떤 차이를 보이는지 한 화면에 배치합니다. 왼쪽 영역에는 LingoQA·WaymoQA·MMStar·MMMU 등의 언어·시각 이해 지표가, 오른쪽 영역에는 NAVSIM PDMS·WOD-E2E RFS·PAI-AV minADE와 3D 인식 지표가 표시됩니다. 본문에 제시된 통합 모델의 다중 작업 평가 결과를 시각적으로 요약한 자료입니다.
교차로 정지·가속·우회와 주차 차량 회피 상황에서 Qwen-Drive가 생성한 주행 reasoning과 예측 궤적을 정답 경로와 비교한 결과입니다.
Diagram이미지는 야간 도로에서 동물을 피하기 위한 감속, 교차로의 우회전과 신호 대응, 정차한 트럭을 지나기 위한 좌측 이동 등 여러 계획 상황을 묶어 보여줍니다. 각 장면에는 모델의 자연어 주행 명령과 차량 카메라 영상, BEV 형태의 후보·예측 경로가 함께 배치되어 시각 입력에서 reasoning과 trajectory가 연결되는 과정을 확인할 수 있습니다. 본문에서 언급한 5초 궤적 생성과 reasoning-conditioned planning의 사례를 시각적으로 보완합니다.
06
Driving VQA와 공간 이해에서 Qwen-Drive-1.0-SFT는 Qwen3.5-4B 기반 모델의 일반 시각 능력을 크게 훼손하지 않으면서 주행 관련 점수를 높였습니다. 예를 들어 LingoQA는 Qwen-Plus를 평가자로 사용한 프로토콜에서 77.8, Ego3D RMSE는 7.78, WaymoQA safety와 all은 각각 70.7과 74.5였고, PAI-AV CoC와 IH는 각각 41.3과 71.0이었습니다. 일반 VQA에서는 MMBench 85.5, MMStar 75.9, MMMU 72.7을 기록했으며 공간 이해에서는 EmbSpatial 78.9와 ERQA 48.5를 얻었습니다.
bash
git clone qwen-drive && cd qwen-drive
# Any Python virtual environment works; conda is shown here
conda create -n qwen-drive python=3.10
conda activate qwen-drive
pip install -e. --no-build-isolation
# or: pip install -r requirements.txt

Python 3.10 환경을 만들고 Qwen-Drive 저장소와 의존성을 설치합니다.

bash
export PYTHONPATH=src python scripts/demo.py --model Qwen-Drive-1.0-4B --planner Qwen-Drive-1.0-4B/planner-rl \
--scenes data/demo/planning_scenes.jsonl --image-archive data/demo/frames.parquet \
--plot demo.png

번들로 제공되는 주행 장면과 프레임을 사용해 계획 결과 요약 그림을 생성합니다.

python
result = model.run(InferenceMode.REASONING_PLANNING, scene=scene, num_samples=6)
print(result.reasoning)
print(result.trajectories.shape) # (6, 50, 3) -> (x, y, heading), 5 s at 10 Hz

추론 기반 계획 모드에서 6개 궤적을 샘플링하고 reasoning과 궤적 텐서 크기를 출력합니다.

07
모델 배포 구조는 루트 디렉터리에 공유 VLM을 두고 planner-sft, planner-rl, perception 헤드를 하위 폴더에 배치하는 방식입니다. Qwen-Drive-1.0-4B 디렉터리는 VLM 9.1GB, 각 Planning Expert 2.1GB, perception head 0.5GB로 구성되며, 헤드는 모델 로딩 시 선택적으로 연결됩니다. 저장소에는 VQA·계획·인식 추론, benchmark 실행, 다중 GPU 평가, 시각화를 다루는 cookbook과 데이터·모델·평가 문서가 함께 포함됩니다.

용어 해설

BEV 인식 헤드(BEV Perception Head)
BEV Perception Head는 여러 카메라 영상을 차량 중심의 Bird’s-Eye View 공간으로 변환해 3D 객체 검출, semantic occupancy 예측, BEV 지도 분할을 수행하는 외부 모듈입니다. Qwen-Drive에서는 공유 VLM 표현에 접근해 3D 장면 정보를 별도로 읽을 수 있는 검사 지점을 형성합니다.
시맨틱 점유 예측(Semantic Occupancy)
Semantic Occupancy는 주행 공간을 3차원 격자 또는 점유 영역으로 나누고 각 위치의 의미적 상태를 예측하는 작업입니다. Qwen-Drive는 카메라 입력에서 차량 주변의 주행 가능 영역과 객체 관련 구조를 추정해 3D 장면 이해와 경로 계획에 필요한 공간 정보를 제공합니다.
모션 플래닝(Motion Planning)
Motion Planning은 현재 장면과 차량 상태를 바탕으로 차량이 앞으로 이동할 궤적을 생성하는 과정입니다. Qwen-Drive의 Planning Expert는 공유 VLM 표현과 현재 ego state를 입력으로 받아 여러 시점의 위치와 heading을 포함한 미래 ego trajectory를 출력합니다.
오픈 루프 평가(Open-loop Evaluation)
Open-loop Evaluation은 실제 차량의 다음 행동이 다시 모델 입력으로 반영되지 않는 고정 데이터셋 환경에서 예측 궤적을 정답과 비교하는 평가 방식입니다. Qwen-Drive는 NAVSIM, Waymo Open Dataset, NVIDIA PhysicalAI-AV의 오픈 루프 지표를 사용해 계획 성능을 측정합니다.
Best-of-N 계획(Best-of-N Planning)
Best-of-N Planning은 하나의 장면에 대해 여러 개의 후보 궤적을 샘플링한 뒤 평가 기준에 가장 적합한 결과를 선택하는 방식입니다. Qwen-Drive의 데모 코드는 6개 후보를 생성하며, NAVSIM 결과도 일반 점수와 best-of-6 점수를 구분해 기록합니다.

기술

  • Qwen-Drive-1.0
  • Qwen3.5-4B
  • Qwen-Plus
  • PyTorch
  • Python 3.10
  • Hugging Face
  • ModelScope
  • FlashAttention 2
  • Apache 2.0

활용 사례

  • 3D 객체 검출과 자율주행 장면 인식
  • Semantic Occupancy 예측
  • BEV 지도 분할
  • Driving VQA와 일반 VQA
  • 미래 ego trajectory 생성
  • 주행 계획 benchmark 평가
  • 다중 시점 주행 영상 분석

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 08.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.