본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Qwen/Qwen-Drive-1.0-4B

자율주행 장면의 시각 질의응답, 3D perception, 미래 주행 궤적 생성4Bapache-2.0

Qwen3.5-4B에 3D perception head와 flow matching 기반 Planning Expert를 결합한 자율주행 VLM

학습 방식 · Qwen3.5-4B 기반의 staged Fine-tuning으로 주행 supervision과 일반 vision-language 데이터를 결합하고, planner-sft는 imitation learning, planner-rl은 NAVSIM PDMS·WOD-E2E RFS·displacement 보상으로 최적화합니다.

TL;DR

Qwen-Drive-1.0-4B는 Qwen3.5-4B를 기반으로 주행 데이터 Fine-tuning을 수행하고, 원래 VLM 구조는 유지한 채 3D perception head와 Planning Expert를 결합한 자율주행 특화 모델입니다. 하나의 VLM 표현에서 3D object detection·semantic occupancy·BEV map segmentation을 산출하고, 별도 Planner는 flow matching으로 미래 ego trajectory를 생성합니다. VQA는 자유 형식 주행 질문에 답하며, perception과 planning은 같은 표현을 공유해 인지 결과와 궤적 예측을 연결합니다. SFT와 reward optimization을 거친 RL Planner를 함께 제공해 open-loop부터 closed-loop까지 평가할 수 있습니다.

핵심 포인트

  • Qwen3.5-4B의 VLM 구조를 그대로 공유하면서 BEV head가 3D detection·occupancy·map segmentation을 함께 산출합니다.
  • Planning Expert가 공유 VLM 표현을 조건으로 flow matching을 수행해 5초 구간의 ego trajectory를 생성합니다.
  • planner-sft는 direct·reasoning planning을 지원하고 planner-rl은 NAVSIM·WOD-E2E 보상으로 추가 최적화됐습니다.
  • 주행 특화 학습 뒤에도 MMBench 85.5, MMStar 75.9, MMMU 72.7로 일반 VLM 능력을 유지합니다.

제한사항

  • BEV perception head는 명시적으로 단순하게 설계되어 고급 perception benchmark용 specialist를 목표로 하지 않습니다.
  • planner-rl은 reasoning-conditioned rollout에서만 reward optimization을 수행했으므로 reasoning planning mode로 실행해야 합니다.
  • 모델 저장소는 VLM 9.1 GB, 각 Planner 2.1 GB, perception head 0.5 GB로 구성되어 전체 배포 용량이 큽니다.

벤치마크

벤치마크지표비교
LingoQAscore77.8Qwen-Drive-1.0-SFT 자체 측정값; Qwen-Plus judge 기준
Ego3D RMSERMSE ↓7.78Qwen-Drive-1.0-SFT 자체 측정값
WOD-E2E RFS val/testRFS ↑8.45/7.91Qwen-Drive-1.0-RL 자체 측정값; SFT 7.95/7.78
NAVSIM PDMSPDMS ↑90.7Qwen-Drive-1.0-RL 자체 측정값; SFT 88.2
AlpaSim at-fault scoreat-fault score ↑0.37Qwen-Drive-1.0-RL 자체 측정값; SFT 0.27
MMBenchscore85.5Qwen-Drive-1.0-SFT 자체 측정값; base Qwen3.5-4B 87.1
MMMUscore72.7Qwen-Drive-1.0-SFT 자체 측정값; base Qwen3.5-4B 73.4
EmbSpatialscore78.9Qwen-Drive-1.0-SFT 자체 측정값; LLaVA-OV2-8B 78.4
WaymoQA allscore74.5Qwen-Drive-1.0-SFT 자체 측정값; base Qwen3.5-4B 67.1

이미지 분석

주행 VQA, motion planning, 3D perception 관련 성능을 모델별 방사형 막대그래프로 비교한 개요 이미지입니다.
왼쪽 그래프는 LingoQA·WaymoQA·MMMU 등 VQA 및 일반 vision-language 점수를, 오른쪽 그래프는 NAVSIM PDMS·WOD-E2E RFS·PAI-AV ADE 등 planning 수치를 비교합니다. Qwen-Drive-1.0 계열은 주행 VQA에서 높은 점수를 기록하며, planner-rl은 NAVSIM PDMS 90.7과 WOD-E2E RFS 7.91을 기록해 인지·계획을 하나의 모델 계열에서 연결하는 구조를 뒷받침합니다.
WOD-E2E open-loop와 AlpaSim close-loop 환경에서 자연어 주행 명령, 실제 영상, 예측 궤적을 함께 비교한 이미지입니다.
상단은 야간·교차로·정차 차량 상황에서 open-loop planning이 생성한 경로를, 하단 격자는 신호등·차선·양보 표지·도로 곡률에 따른 close-loop 주행 궤적을 시간별로 나타냅니다. 각 장면에서 자연어 명령과 카메라 영상 옆에 여러 후보 경로와 선택 경로가 배치되어, Planner가 주행 맥락을 궤적 좌표로 변환하는 처리 흐름을 확인할 수 있습니다.
여러 카메라 영상에서 3D object detection, BEV 표현, semantic occupancy, map segmentation 예측과 ground truth를 비교한 이미지입니다.
각 행은 도심 주행 장면에 대해 multi-view 3D bounding box, BEV-view, occupancy의 prediction·ground truth, map segmentation의 prediction·ground truth를 나란히 배치합니다. 차량·보행자·자전거·장벽과 주행 가능 영역·차선·도로 가장자리·횡단보도·보도 같은 구조가 같은 입력에서 함께 추정되어, 단일 VLM 표현에 여러 3D perception 출력을 연결한 구성을 확인할 수 있습니다.

88

LIKES

1.6k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.