용어 해설
- 비전-언어 모델(Vision-Language Model (VLM))
- — 이미지와 텍스트를 결합해 멀티모달 표현을 학습한 대형 사전학습 모델로서 본문에서는 VLA의 백본으로 쓰여 시각적 속성(색상, 위치, 형태)과 언어적 개념을 동시에 제공하는 표상 소스로 기능한다.
- 행동 복제(Behavior Cloning (BC))
- — 전문가 시연에서 관찰한 상태-동작 쌍을 지도학습으로 그대로 모방하도록 정책을 학습하는 방법으로 본문에서는 VLM을 제어 정책으로 미세조정할 때 사용되며, 표상 소실 문제의 원인으로 지목된다.
- 치명적 망각(Catastrophic Forgetting)
- — 사전학습된 표현이 파인튜닝 과정에서 빠르게 망가져 원래 갖고 있던 시각·언어 지식이 손실되는 현상으로서, VLA가 새로운 행동 데이터에 맞춰지면서 색상·공간 개념을 잃는 원인으로 작동한다.
- 비전-언어 앵커링(Vision-Language Anchoring)
- — 파인튜닝 중에 학습 가능한 백본과 동일한 입력을 처리하는 고정된(동결된) VLM을 교사로 두고 각 디코더 레이어의 히든스테이트를 평균 제곱오차로 맞추는 층별 증류 방식으로, 표상 드리프트를 억제해 OOD 일반화를 유지한다.
- 언어-행동 정렬(Language-Action Alignment)
- — 연속 동작 목표를 방향 단어(예: left, forward 등)로 자동 변환하여 동일한 관찰에서 언어 헤드와 행동 헤드를 공동 감독하는 손실을 적용함으로써 언어 예측과 행동 예측이 일관되게 되도록 만드는 기법이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





