본문으로 건너뛰기
HF Daily Papers조회 1

표상 앵커링과 언어-행동 정렬을 통한 일반화 가능한 VLA 파인튜닝

Anchor-Align는 층별 고정 교사 증류와 행동을 언어 레이블로 변환한 동일-관찰 공동 감독을 결합해 VLM 표상을 보존하고 언어와 행동을 정렬함으로써 시뮬레이션과 실제 로봇에서 OOD 일반화와 성공률을 유의하게 향상했다.

용어 해설

비전-언어 모델(Vision-Language Model (VLM))
이미지와 텍스트를 결합해 멀티모달 표현을 학습한 대형 사전학습 모델로서 본문에서는 VLA의 백본으로 쓰여 시각적 속성(색상, 위치, 형태)과 언어적 개념을 동시에 제공하는 표상 소스로 기능한다.
행동 복제(Behavior Cloning (BC))
전문가 시연에서 관찰한 상태-동작 쌍을 지도학습으로 그대로 모방하도록 정책을 학습하는 방법으로 본문에서는 VLM을 제어 정책으로 미세조정할 때 사용되며, 표상 소실 문제의 원인으로 지목된다.
치명적 망각(Catastrophic Forgetting)
사전학습된 표현이 파인튜닝 과정에서 빠르게 망가져 원래 갖고 있던 시각·언어 지식이 손실되는 현상으로서, VLA가 새로운 행동 데이터에 맞춰지면서 색상·공간 개념을 잃는 원인으로 작동한다.
비전-언어 앵커링(Vision-Language Anchoring)
파인튜닝 중에 학습 가능한 백본과 동일한 입력을 처리하는 고정된(동결된) VLM을 교사로 두고 각 디코더 레이어의 히든스테이트를 평균 제곱오차로 맞추는 층별 증류 방식으로, 표상 드리프트를 억제해 OOD 일반화를 유지한다.
언어-행동 정렬(Language-Action Alignment)
연속 동작 목표를 방향 단어(예: left, forward 등)로 자동 변환하여 동일한 관찰에서 언어 헤드와 행동 헤드를 공동 감독하는 손실을 적용함으로써 언어 예측과 행동 예측이 일관되게 되도록 만드는 기법이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 15.수집 2026. 07. 24.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.