용어 해설
- 1인칭 시점 비디오(Egocentric Videos)
- — 사용자의 시야에서 촬영된 비디오로, 손의 조작과 주변 물체 상호작용을 풍부하게 포함한다. 본문 맥락에서는 인간 손의 조작 궤적과 시점 정보를 로봇 조작 학습 신호로 변환하는 원천 데이터로 활용된다. 노이즈·카메라 흔들림·가려짐 문제가 있어 정제와 4D 복원이 중요하다.
- 시각-언어-행동 모델(Vision-Language-Action Model)
- — 입력으로 이미지와 자연어 지시를 받고, 연속적 로봇 동작을 출력하는 모델 계열이다. 본 논문에서는 Qwen3-VL 백본과 flow 기반 액션 익스퍼트를 결합해 연속적 행동 청크를 예측하도록 설계되었다. 시각 언어 이해와 연속 행동 생성 간의 정렬이 성능 핵심이다.
- 실시간 청크 실행(Real-Time Chunking (RTC))
- — 실행 시점의 지연을 없애기 위해 행동 시퀀스의 앞부분을 예약(prefix)하고 이후 예측된 청크로 매끄럽게 전환하는 기법이다. 학습 시에는 무작위 지연을 삽입해 suffix를 노이즈 제거 방식으로 학습하여 전환 시 단절이 생기지 않게 만든다. 로봇의 연속 제어에서 실행 공백을 제거하는 데 중요하다.
- 플로우 매칭(Flow Matching)
- — 확률적 노이즈와 목표 행동 사이의 선형 속도장을 회귀하도록 학습하는 방법으로, 연속적 행동 분포를 모델링한다. 본문에서는 Conditional Flow Matching을 사용해 컨텍스트를 조건으로 행동 suffix의 선형 속도장을 예측하도록 학습했다. 샘플 효율과 안정성 측면에서 연속 행동 생성에 적합하다.
- DINOv3 특징 벡터(DINOv3 Features)
- — 이미지의 고수준 표현을 제공하는 비지도 학습 기반 특징으로, 미래 상태를 예측할 때 안정적인 감독 신호로 쓰인다. 본문에서는 행동이 유도할 미래 프레임의 DINOv3 특징을 세계모델 전문가가 회귀하도록 하여 백본의 행동 상상력을 강화했다. 생성 손실보다 안정적인 대안으로 채택되었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


