용어 해설
- 시각-언어-행동 모델(Vision-Language-Action (VLA))
- — 시각적 관찰과 자연어 지시를 입력으로 받아 로봇의 연속된 행동 궤적을 출력하는 통합 모델 계열이다. 본 논문에서는 대규모 실제 조작 궤적과 언어화된 상태전이(conditioning)를 결합해 행동생성을 학습하는 주된 프레임워크로 사용되며, 일반화된 행동 생성 능력을 얻기 위해 사전학습과 교체적 정렬(post-training)을 적용했다.
- 플로우 매칭(Flow Matching)
- — 확산 기반 연속 행동 생성에서 모델이 예측하는 벡터 필드 v_theta를 목표 장(u)과 L2 손실로 일치시키는 학습법이다. 노이즈 혼합 샘플 a~와 시간 τ를 입력으로 받아 벡터 차이를 최소화함으로써 역확산(recovery) 과정에서 깨끗한 행동을 복원하도록 학습한다.
- 확산 변환기(Diffusion Transformer (DiT))
- — Transformer 구조를 기반으로 flow-matching 손실을 통해 연속적 행동 청크를 생성하는 모듈이다. 본 논문에서는 VLM의 KV 캐시를 조건으로 받아 행동 벡터 필드를 예측하고, 5-스텝 Euler 통합으로 노이즈 초기값에서 행동을 복원한다.
- UMI 장치(UMI devices)
- — 휴대형 핸드헬드 조작기구와 시야가 결합된 데이터 수집 장치로서, 실제 환경에서 대규모 조작 궤적을 저비용으로 수집하게 해준다. 논문에서는 100,000시간 이상의 전처리 데이터 원천으로 사용되어 다양성과 규모 확보에 기여했다.
- Choice Policies
- — VLM 내부에서 K개의 후보 행동 청크와 각 후보의 점수를 예측한 뒤, 가장 행동 손실이 작은 후보를 선택하여 회귀 손실에 포함시키는 보조 감독 기법이다. 이 기법은 VLM의 표현을 행동생성에 적합하도록 유도하여 DiT 학습 수렴을 가속하는 역할을 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






