용어 해설
- 분포 기반 보상(Distribution-wise Reward)
- — 개별 샘플 대신 샘플 집합의 통계적 분포 적합도를 보상 신호로 사용하여 생성 모델이 전체 데이터 분포의 모드를 폭넓게 커버하도록 유도하는 방법이다. 이 방식은 FID 같은 분포 간 거리 측정치를 음수 보상으로 사용하며, 개별 샘플 최적화에 따른 reward hacking을 완화한다.
- 서브셋 교체 전략(Subset-Replace Strategy)
- — 레퍼런스 세트에서 소규모 서브셋만 임의로 새로 생성한 샘플로 교체하고 교체된 전체 집합의 FID를 계산하여 각 교체된 샘플에 분포 기반 보상을 할당하는 방법이다. 전체 50K 샘플을 쓰는 대신 계산 비용을 크게 낮추면서 밀도 높은 보상 신호를 얻는다.
- 모델 병합(Model Merging)
- — 훈련 궤적에서 여러 체크포인트의 파라미터를 가중합하여 최종 파라미터를 구성하는 기법으로, 가중치 계수 최적화를 통해 단일 모델의 성능 및 안정성을 개선할 수 있다. 본문에서는 이 계수를 RL로 최적화하여 ODE 기반 추론과 일관성을 확보한다.
- SDE-ODE 불일치(SDE-ODE Inconsistency)
- — 훈련 시 확률적 탐색을 위해 사용하는 SDE 기반 롤아웃에서 얻은 최적화 이득이 결정적 ODE 기반 추론으로 잘 이전되지 않는 현상이다. 이 논문은 이 불일치를 해소하기 위해 모델 병합 계수를 ODE 환경에서 직접 최적화한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






