본문으로 건너뛰기

UniDriveVLA: 자율 주행을 위한 이해, 인지 및 행동 계획의 통합

UniDriveVLA는 Mixture-of-Transformers 구조를 통해 자율 주행 시스템의 공간 인지와 의미론적 추론 능력을 통합한 VLA 모델이다.

섹션별 상세

01
기존 VLA 모델은 2D 기반의 의미론적 추론과 3D 기반의 공간 인지 사이에서 성능 타협이 발생하는 한계가 있었다.
02
UniDriveVLA는 Mixture-of-Transformers 구조를 사용하여 주행 이해, 장면 인지, 행동 계획 전문가를 독립적으로 구성해 파라미터 간 간섭을 최소화한다.
03
마스크된 공동 어텐션 기법을 통해 서로 다른 전문가들이 필요한 정보만 선택적으로 공유하며 효율적으로 협업하도록 설계했다.
04
희소 인지 패러다임(sparse perception paradigm)과 3단계 점진적 학습 전략을 결합하여 의미론적 추론 능력을 유지하면서도 정밀한 공간 인지를 학습시킨다.
05
nuScenes 오픈 루프 평가와 Bench2Drive 클로즈 루프 평가 모두에서 기존 모델들을 능가하는 최첨단 성능을 달성했다.
06
단순 주행뿐만 아니라 3D 객체 탐지, 온라인 맵핑, 동작 예측, 주행 중심 VQA 등 다양한 하위 작업에서도 뛰어난 범용성을 보여준다.

용어 해설

시각-언어-행동 모델(VLA Model)
시각적 입력과 언어적 이해를 결합하여 구체적인 물리적 행동(Action)을 출력하는 AI 모델이다. 자율 주행이나 로보틱스에서 주변 환경을 인식하고 상황을 판단하여 제어 명령을 생성하는 데 사용된다.
트랜스포머 혼합 구조(Mixture-of-Transformers)
여러 개의 Transformer 전문가(Expert)를 병렬로 배치하여 각기 다른 작업(인지, 추론 등)을 전문적으로 처리하게 하는 아키텍처이다. 특정 파라미터가 특정 기능에 집중하게 함으로써 기능 간 간섭을 줄인다.
오픈 루프 평가(Open-loop Evaluation)
모델의 출력이 다음 입력에 영향을 주지 않는 정적 데이터셋 기반의 평가 방식이다. 과거 기록된 데이터를 바탕으로 모델이 예측한 경로와 실제 경로의 오차를 측정하여 성능을 판별한다.
클로즈 루프 평가(Closed-loop Evaluation)
모델의 행동 결과가 실시간으로 환경에 반영되고 다음 입력값에 영향을 주는 시뮬레이션 기반 평가이다. 자율 주행 시스템이 실제 주행 상황에서 얼마나 안전하고 일관되게 반응하는지 측정하는 데 필수적이다.
희소 인지(Sparse Perception)
전체 공간 데이터를 모두 처리하는 대신 핵심적인 특징점이나 객체 정보만을 선택적으로 추출하여 처리하는 방식이다. 연산 효율성을 높이면서도 중요한 공간 정보를 유지하는 데 유리하다.

기술

  • UniDriveVLA
  • Mixture-of-Transformers
  • nuScenes
  • Bench2Drive

활용 사례

  • 자율 주행 경로 계획
  • 3D 객체 탐지
  • 실시간 온라인 맵핑
  • 주행 상황 질의응답 (Driving VQA)

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 02.수집 2026. 04. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.