본문으로 건너뛰기
HF Daily Papers조회 1

자율주행용 통합 Vision-Language 모델 Qwen-Drive-1.0

Qwen-Drive-1.0은 Qwen3.5-4B에 BEV 인식 헤드와 Planning Expert를 결합해 3D 인식·Driving VQA·Motion Planning을 통합한다.

용어 해설

Bird’s-Eye View(Bird’s-Eye View (BEV))
차량을 위에서 내려다본 좌표계로 주변 장면을 표현하는 방식입니다. 여러 카메라의 특징을 차량 중심 평면으로 변환해 객체 위치, 점유 공간, 도로 구조를 같은 공간에서 예측하므로 자율주행의 3D 인식과 경로 계획을 연결하는 기준 표현으로 사용됩니다.
Semantic Occupancy Prediction
3D 공간의 각 voxel이 비어 있는지, 주행 가능한지, 차량·보행자 같은 어떤 의미를 갖는지 예측하는 작업입니다. 객체 상자보다 연속적인 공간 구조를 표현하며, Qwen-Drive-1.0은 3D UNet으로 BEV 특징과 높이 정보를 결합해 voxel별 의미를 출력합니다.
Flow Matching
잡음 상태에서 목표 궤적으로 이동하는 연속적인 흐름을 학습하는 생성 방법입니다. 이 논문에서는 50개 waypoint로 구성된 정답 궤적과 Gaussian noise를 선형 보간하고, Planning Expert가 깨끗한 최종 궤적을 직접 예측하도록 학습한 뒤 10단계 Euler 적분으로 경로를 복원합니다.
Catastrophic Forgetting
특정 도메인 데이터로 모델을 추가 학습할 때 사전학습으로 얻은 일반 지식과 능력이 급격히 약화되는 현상입니다. Qwen-Drive-1.0은 driving 데이터와 general-purpose vision-language 데이터를 Stage 2에서 함께 학습해 자율주행 능력과 일반적인 시각 이해·instruction following의 균형을 유지하려고 합니다.
Open-Loop Evaluation
모델이 한 번 예측한 경로를 실제 환경의 반응 없이 기록된 미래와 비교하는 평가 방식입니다. WOD-E2E에서는 ADE로 기록 궤적과의 위치 차이를 계산하고, RFS로 여러 사람이 허용한 후보 경로 중 가장 가까운 유효 경로의 평가 점수를 반영합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 31.수집 2026. 09. 03.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.