용어 해설
- 시각-언어 모델(Vision-Language Model (VLM))
- — 이미지와 텍스트를 함께 입력받아 장면, 객체, 공간 관계, 지시문을 해석하는 모델입니다. 이 논문에서는 VLM의 의미적 추론 결과를 로봇의 세밀한 움직임으로 연결하는 기반 모델로 사용합니다.
- 시각-언어-행동 모델(Vision-Language-Action (VLA))
- — 시각·언어 입력을 로봇의 저수준 행동으로 직접 변환하도록 학습한 모델입니다. 일반적으로 특정 로봇의 연속 궤적을 회귀하므로 새로운 환경이나 embodiment마다 추가 데이터와 적응이 필요합니다.
- 제로샷 로봇 제어(Zero-Shot Robot Control)
- — 로봇 제어용 추가 Fine-tuning 없이 이미 학습된 모델이 새로운 작업을 수행하는 방식입니다. Show-Harness는 VLM의 출력과 로봇별 실행기를 연결해 이 방식을 구현합니다.
- 로봇 embodiment별 실행기(Embodiment-Specific Interpreter)
- — 동일한 semantic action을 각 로봇의 좌표계, 관절 제어기, 작업공간 제한에 맞는 저수준 명령으로 결정적으로 변환하는 모듈입니다. 로봇이 바뀌어도 VLM의 행동 어휘는 유지됩니다.
- 시뮬레이션-현실 전이(Sim-to-Real Transfer)
- — 시뮬레이터에서 수집하거나 학습한 정책을 실제 로봇에 적용하는 과정입니다. 이 논문은 GUMI의 동일한 semantic action 공간으로 수집한 시뮬레이션 시연을 실제 Franka 평가에 사용합니다.
- 저순위 적응(LoRA)
- — 기존 모델의 전체 가중치를 갱신하지 않고 저순위 행렬을 추가해 일부 파라미터만 학습하는 Fine-tuning 방식입니다. 논문에서는 Qwen3.5-2B의 선형층에 rank-64 LoRA를 적용하고 약 3%의 파라미터만 갱신합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






