본문으로 건너뛰기

분포 기반 보상으로 시각 생성 모델 최적화

샘플 단위 보상으로 강화학습을 적용하면 보상 해킹과 모드 붕괴가 발생하여 생성물의 다양성과 전체적 분포 적합도가 악화될 수 있다. 본 논문은 분포 단위의 보상을 효율적으로 추정하고 이를 RL 신호로 활용함으로써 시각 생성 모델의 지각 품질과 분포 커버리지를 동시에 개선했다. 결과적으로 사후 병합과 결합한 접근은 SDE-기반 훈련과 ODE-기반 추론 간 불일치를 완화하는 실제적 대안을 제시한다.

용어 해설

분포 기반 보상(Distribution-wise Reward)
개별 샘플 대신 샘플 집합의 통계적 분포 적합도를 보상 신호로 사용하여 생성 모델이 전체 데이터 분포의 모드를 폭넓게 커버하도록 유도하는 방법이다. 이 방식은 FID 같은 분포 간 거리 측정치를 음수 보상으로 사용하며, 개별 샘플 최적화에 따른 reward hacking을 완화한다.
서브셋 교체 전략(Subset-Replace Strategy)
레퍼런스 세트에서 소규모 서브셋만 임의로 새로 생성한 샘플로 교체하고 교체된 전체 집합의 FID를 계산하여 각 교체된 샘플에 분포 기반 보상을 할당하는 방법이다. 전체 50K 샘플을 쓰는 대신 계산 비용을 크게 낮추면서 밀도 높은 보상 신호를 얻는다.
모델 병합(Model Merging)
훈련 궤적에서 여러 체크포인트의 파라미터를 가중합하여 최종 파라미터를 구성하는 기법으로, 가중치 계수 최적화를 통해 단일 모델의 성능 및 안정성을 개선할 수 있다. 본문에서는 이 계수를 RL로 최적화하여 ODE 기반 추론과 일관성을 확보한다.
SDE-ODE 불일치(SDE-ODE Inconsistency)
훈련 시 확률적 탐색을 위해 사용하는 SDE 기반 롤아웃에서 얻은 최적화 이득이 결정적 ODE 기반 추론으로 잘 이전되지 않는 현상이다. 이 논문은 이 불일치를 해소하기 위해 모델 병합 계수를 ODE 환경에서 직접 최적화한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 02.수집 2026. 07. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.