본문으로 건너뛰기

프레임 순서 기반 진행도만으로 학습하는 Rank-Then-Act

전문가 비디오에서 프레임의 상대적 시간순서를 VLM으로 학습한 뒤 Spearman 순위상관을 슬라이딩 윈도우 보상으로 사용해 보상 없이 정책을 학습했다.

용어 해설

서열(순서) 기반 감독(Ordinal Supervision)
서열 기반 감독은 영상 프레임의 상대적 시간적 순서를 학습 신호로 사용한다. 모델은 프레임들이 어떤 시간적 순서를 가지는지 예측하며 이 정보를 통해 절대적 보상 값 대신 순서 일치 정도를 학습 신호로 활용한다. 본 논문에서는 이 서열 정보를 Spearman 순위상관을 통해 보상으로 변환해 정책 학습에 사용한다.
그룹 상대 정책 최적화(GRPO)
GRPO는 텍스트 생성 과정을 정책으로 간주해 listwise 보상 신호를 최적화하는 방식이다. 출력 토큰 시퀀스에 대해 중요도 가중치와 그룹 단위 이점을 계산해 PPO 유사 클리핑 손실로 최적화한다. 본 논문은 VLM의 출력으로부터 얻은 순위 기반 Spearman 보상을 GRPO로 최대화해 프레임 순서 회복 능력을 학습시켰다.
스피어만 순위 상관계수(Spearman ρ)
Spearman ρ는 두 벡터의 순위 간 피어슨 상관을 계산해 [-1,1]로 정규화된 일치도를 제공한다. 예측된 프레임 순위와 실제 타임스탬프 순위를 입력으로 받아 순서 일치도를 측정하며, 이 값이 보상 신호로 쓰이면 스케일에 무관한 학습 신호가 확보된다. 본 방법은 보상 캘리브레이션 없이 서로 다른 에피소드·과제 간 보상 재사용을 가능하게 한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 02.수집 2026. 07. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.