본문으로 건너뛰기

VLA는 기본을 알고 있는가? Vision–Language–Action 모델의 상식 및 세계지식 보존 측정

로봇형 에이전트는 단순한 모터 제어를 넘어 상황에 맞는 상식과 세계 지식을 행동으로 옮길 수 있어야 실제 환경에서 유용하다. 이 논문은 VLM을 VLA로 전환할 때 그런 지식이 유지되는지 행동 기반으로 직접 측정하여 제어 실패와 지식 상실을 구분하는 방법을 제공한다. 연구 결과는 단순 지각 능력은 대체로 보존되지만 심화된 의미적 지식은 손실되기 쉬워 향후 학습 목표와 아키텍처 재설계의 필요성을 실증적으로 뒷받침한다.

용어 해설

레이어별 의도 프로빙(Layerwise Intent Probing)
모델의 각 층에서 선형 분류기를 학습하여 특정 질문의 정답 정보를 얼마나 회복 가능한지 측정하는 기법으로, 입력에서 내부 활성화까지 어떤 층에 답변 관련 신호가 보존되는지를 정량화하기 위해 사용된다.
소프트 성공률(Soft Success Rate)
행동 기반 선택 시험에서 목표 타일 중심으로 반경 ε 이내에 물체가 놓이면 성공으로 간주하여 계산하는 확률적 성능 지표로서, 모터 제어 실패와 의미적 선택을 분리하여 지식 기반 행동 성공을 해석하는 데 사용된다.
Vision–Language–Action 모델(Vision–Language–Action (VLA))
이미지와 자연어를 입력으로 받아 행동(예: 로봇의 단일 동작)을 출력하도록 미세조정된 멀티모달 정책 계열을 가리키며, 시각적 이해와 언어 추론을 모터 제어로 연결하는 파이프라인 특성이 핵심이다.
Vision–Language Model(Vision–Language Model (VLM))
이미지와 텍스트를 함께 입력으로 처리하도록 사전학습된 멀티모달 모델로서, VLA의 백본으로 사용되어 시맨틱한 시각-언어 표현을 제공하고 행동 결정에 필요한 지식을 포함할 수 있다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 17.수집 2026. 07. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.