본문으로 건너뛰기

인간 시연을 넘어서는 End-to-End 주행

DriveRL의 폐루프 강화학습 행동을 DriveVFM 기반 카메라 Planner로 증류해 인간 주행 기록 없이 SOTA를 달성합니다.

용어 해설

폐루프 강화학습(Closed-Loop Reinforcement Learning)
정책이 자신의 행동을 환경에 적용하고 그 결과로 바뀐 상태를 다시 관측하면서 학습하는 방식입니다. 고정된 인간 주행 기록만 모방하지 않고, 실패·복구·안전 위반에 대한 보상 신호를 통해 행동을 갱신합니다. DriveRL에서는 차량과 주변 교통 참여자가 함께 움직이는 시뮬레이션에서 PPO를 수행합니다.
비전 Foundation Model(Vision Foundation Model)
대규모 이미지 데이터로 사전 학습되어 다양한 시각적 특징을 제공하는 모델입니다. DINOv3는 공간 구조, SigLIP2는 이미지 의미, SAM은 경계와 객체 영역, Depth Anything V2는 기하 정보를 제공하며 DriveVFM은 이 특징을 하나의 주행용 Backbone으로 통합합니다.
지식 증류(Knowledge Distillation)
Teacher 모델의 출력이나 내부 표현을 Student 모델의 학습 목표로 삼아, 더 작거나 다른 입력 형식의 모델로 지식을 옮기는 방법입니다. DriveZero는 구조화된 장면 정보를 받는 DriveRL의 주행 궤적을 카메라 입력만 받는 Planner에 전달합니다.
Winner-Takes-All 학습(Winner-Takes-All)
여러 후보 출력 중 정답과 가장 가까운 후보 하나만 회귀 손실에 참여시키는 방식입니다. DriveZero는 64개의 궤적 후보를 생성한 뒤 Teacher 궤적과 L1 거리가 가장 작은 후보를 선택해 학습하므로, 서로 다른 주행 모드가 각 Query에 분산될 수 있습니다.
가치 기반 테스트 시간 행동 탐색(Value-Guided Test-Time Action Search)
학습된 정책의 최빈 행동과 정책에서 샘플링한 대안 행동을 짧은 Rollout으로 비교하는 추론 기법입니다. 각 후보의 즉시 보상과 Critic이 예측한 미래 수익을 합산하고, 일정 마진 이상 우수한 후보가 있을 때만 최빈 행동을 교체합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 05.수집 2026. 09. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.