용어 해설
- SDE-GRPO
- — Stochastic-Differential-Equation 기반 GRPO로 비디오 생성의 확률적 샘플링을 가능하게 하여 로그-확률 계산과 정책 경사 계산을 가능하게 한다.
- Early-Step Focus
- — 초기에 denoising 단계에 집중하여 구조적 신호를 유지하면서 학습 효율을 높이는 전략.
- 밀집 분해 보상(dense decomposed rewards)
- — 목표 달성의 중간 단계에 대한 보상을 제공해 샘플의 다양성 감소에도 학습 신호를 유지하는 보상 설계.
- 검증 가능한 보상(verifiable rewards)
- — 규칙 기반 검증으로 결정되는 보상 신호로, 출력의 정합성을 자동으로 확인할 수 있게 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.