용어 해설
- 시간적 Wasserstein 보상(Temporal Wasserstein)
- — 예측된 간격 집합과 목표 간격 집합의 병합된 지지를 균일 분포로 취급하고 1차원 W1 거리를 계산하여 예측 위치와 목표 지지의 정렬에 필요한 '운반량'을 정량화하는 보상이다. 이 보상은 분할(fragmentation)과 예측 간 개수 불일치에 불변성을 가지며 근접한 'near miss' 에 대한 연속적 학습 신호를 제공한다.
- 집합값 감독(Set-valued Supervision)
- — 타임라인 상에서 단일 구간 대신 가변 개수의 지원 간격 집합을 정답 표기로 사용하여 반복 출현, 분할 구간, 그리고 긴 비디오 문맥을 보존하면서 학습 신호를 구성하는 감독 방식이다. 이 표기는 다중 스팬 예시를 자연스럽게 표현하고 이를 일관된 최적화 대상으로 만든다.
- 시간적 IoU(Temporal IoU)
- — 예측된 병합 지지와 목표 병합 지지의 교집합 길이를 합집합 길이로 나눈 값으로, 이미 맞춘 지원량의 비율을 측정한다. 중첩된 부분에 대해서는 정밀한 평가를 제공하지만 비중첩 예측에는 0을 부여해 근접성 정보가 소실될 수 있다.
- GRPO
- — 집단화된 생성 기반 정책 최적화로, 다수의 샘플 롤아웃 그룹 내 상대적 보상 순위를 이용해 디코더 기반 생성 모델의 출력을 최적화하는 강화학습 절차이다. 그룹 내 평균 중심화(mean-centering)를 적용하여 집단 상대 선호를 정책 갱신에 반영한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




