본문으로 건너뛰기
HF Daily Papers조회 1

Show-Harness로 VLM을 로봇 제어에 연결

Show-Harness는 VLM의 의미 행동을 로봇별 실행기의 작은 물리 동작으로 변환해 제로샷·저비용 로봇 제어를 구현합니다.

용어 해설

시각-언어 모델(Vision-Language Model (VLM))
이미지와 텍스트를 함께 입력받아 장면, 객체, 공간 관계, 지시문을 해석하는 모델입니다. 이 논문에서는 VLM의 의미적 추론 결과를 로봇의 세밀한 움직임으로 연결하는 기반 모델로 사용합니다.
시각-언어-행동 모델(Vision-Language-Action (VLA))
시각·언어 입력을 로봇의 저수준 행동으로 직접 변환하도록 학습한 모델입니다. 일반적으로 특정 로봇의 연속 궤적을 회귀하므로 새로운 환경이나 embodiment마다 추가 데이터와 적응이 필요합니다.
제로샷 로봇 제어(Zero-Shot Robot Control)
로봇 제어용 추가 Fine-tuning 없이 이미 학습된 모델이 새로운 작업을 수행하는 방식입니다. Show-Harness는 VLM의 출력과 로봇별 실행기를 연결해 이 방식을 구현합니다.
로봇 embodiment별 실행기(Embodiment-Specific Interpreter)
동일한 semantic action을 각 로봇의 좌표계, 관절 제어기, 작업공간 제한에 맞는 저수준 명령으로 결정적으로 변환하는 모듈입니다. 로봇이 바뀌어도 VLM의 행동 어휘는 유지됩니다.
시뮬레이션-현실 전이(Sim-to-Real Transfer)
시뮬레이터에서 수집하거나 학습한 정책을 실제 로봇에 적용하는 과정입니다. 이 논문은 GUMI의 동일한 semantic action 공간으로 수집한 시뮬레이션 시연을 실제 Franka 평가에 사용합니다.
저순위 적응(LoRA)
기존 모델의 전체 가중치를 갱신하지 않고 저순위 행렬을 추가해 일부 파라미터만 학습하는 Fine-tuning 방식입니다. 논문에서는 Qwen3.5-2B의 선형층에 rank-64 LoRA를 적용하고 약 3%의 파라미터만 갱신합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 09.수집 2026. 09. 11.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.