본문으로 건너뛰기

로봇 데이터 한계를 표현 학습으로 넘는 VLAct

VLAct는 VLM 표현을 보존하고 여러 행동 헤드·로봇 형태의 지식을 공동 학습해 제한된 로봇 데이터에서도 전이 성능을 높입니다.

용어 해설

비전-언어-행동 모델(Vision-Language-Action)
이미지와 언어 입력을 바탕으로 로봇 행동을 출력하는 모델입니다. VLM의 시각·언어 표현에 로봇 궤적 학습을 결합해 물체, 공간 관계, 작업 지시를 실제 제어 명령으로 연결합니다. VLAct는 이 backbone을 여러 로봇 형태와 행동 출력 방식에 재사용할 수 있도록 계속 학습합니다.
계속 사전학습(Continued Pre-training)
처음부터 foundation model을 학습하는 대신, 이미 학습된 VLM을 로봇 궤적과 추가 데이터로 다시 학습하는 단계입니다. 이 과정에서 backbone 내부에 행동 관련 지식을 넣은 뒤, downstream 작업에서는 새 action head를 붙여 task-specific fine-tuning을 수행합니다.
행동 출력 헤드(Action Head)
backbone의 잠재 표현을 로봇의 실제 행동 시퀀스로 변환하는 출력 모듈입니다. FAST처럼 이산 토큰을 쓰거나 OFT, PI, GR00T처럼 연속값을 예측하는 방식이 있으며, 사전학습에 사용한 헤드의 구조가 backbone 표현을 특정 decoding geometry에 치우치게 만들 수 있습니다.
로봇 형태 간 전이(Cross-Embodiment Transfer)
학습에 사용하지 않은 로봇 형태로 시각·행동 지식을 옮기는 능력입니다. 로봇마다 관절 수와 운동학이 다르므로 모든 출력 좌표를 억지로 공유하지 않고, 의미가 같은 gripper 차원만 공유하며 호환되지 않는 arm 차원은 분리·마스킹하는 방식이 핵심입니다.
주기 관절각 인식 손실(Wrap-aware Loss)
주기적인 관절각에서 각도의 경계가 가깝다는 점을 반영하는 회귀 손실입니다. 일반 회귀는 179°와 -179°를 358° 차이로 계산하지만, 실제 회전 차이는 2°입니다. VLAct는 periodic joint 차원의 잔차를 360° 기준으로 계산해 불연속적인 오차를 줄입니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 27.수집 2026. 09. 01.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.