용어 해설
- 서열(순서) 기반 감독(Ordinal Supervision)
- — 서열 기반 감독은 영상 프레임의 상대적 시간적 순서를 학습 신호로 사용한다. 모델은 프레임들이 어떤 시간적 순서를 가지는지 예측하며 이 정보를 통해 절대적 보상 값 대신 순서 일치 정도를 학습 신호로 활용한다. 본 논문에서는 이 서열 정보를 Spearman 순위상관을 통해 보상으로 변환해 정책 학습에 사용한다.
- 그룹 상대 정책 최적화(GRPO)
- — GRPO는 텍스트 생성 과정을 정책으로 간주해 listwise 보상 신호를 최적화하는 방식이다. 출력 토큰 시퀀스에 대해 중요도 가중치와 그룹 단위 이점을 계산해 PPO 유사 클리핑 손실로 최적화한다. 본 논문은 VLM의 출력으로부터 얻은 순위 기반 Spearman 보상을 GRPO로 최대화해 프레임 순서 회복 능력을 학습시켰다.
- 스피어만 순위 상관계수(Spearman ρ)
- — Spearman ρ는 두 벡터의 순위 간 피어슨 상관을 계산해 [-1,1]로 정규화된 일치도를 제공한다. 예측된 프레임 순위와 실제 타임스탬프 순위를 입력으로 받아 순서 일치도를 측정하며, 이 값이 보상 신호로 쓰이면 스케일에 무관한 학습 신호가 확보된다. 본 방법은 보상 캘리브레이션 없이 서로 다른 에피소드·과제 간 보상 재사용을 가능하게 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





