본문으로 건너뛰기
HF Daily Papers조회 1

DiffusionOPSD로 확산 모델 보상을 중간 예측 목표로 변환

DiffusionOPSD는 reward gradient로 확산 모델의 중간 denoising 목표를 만들고 20개 설정 중 19개에서 최고 점수를 기록했다.

용어 해설

온폴리시 자기 증류(On-Policy Self-Distillation)
현재 학습 중인 정책이 실제로 생성한 궤적을 학습 자료로 삼아 자기 자신을 갱신하는 방식입니다. DiffusionOPSD에서는 고정된 행동 정책이 생성한 상태와 기준점을 이용해 보상 기반의 중간 예측 목표를 만들고, 학습 정책이 이를 맞추도록 업데이트합니다.
종단 보상(Endpoint Reward)
생성 과정의 마지막 이미지에 대해 품질이나 선호도를 평가하는 보상입니다. 중간 denoising 단계의 예측을 직접 지정하지 않으므로, 보상 신호를 중간 단계의 학습 목표로 변환하는 추가 절차가 필요합니다.
Denoising 예측(Denoising Prediction)
확산 모델이 현재 noisy 상태에서 깨끗한 출력 또는 다음 복원 방향을 예측하는 값입니다. 이 논문에서는 reward gradient를 이용해 기준점 주변의 양·음의 목표를 만들고, 해당 예측을 직접 학습시키는 감독 신호로 사용합니다.
행동 정책(Behavior Policy)
현재 학습 데이터를 생성하는 고정된 확산 정책입니다. 각 외부 반복에서 trajectory와 query state, anchor를 공급하며, 학습 정책의 업데이트가 끝난 뒤 exponential moving average로 새 상태를 반영합니다.
보상 gradient(Reward Gradient)
생성된 이미지의 보상이 변하는 방향을 나타내는 미분 신호입니다. DiffusionOPSD는 이 신호를 기준점 주변의 제한된 positive target과 negative target으로 바꾸어 image-level 보상을 중간 denoising 예측의 학습 목표로 변환합니다.
유한 fitting(Finite Fitting)
새로 만든 목표를 학습 정책이 한 번 또는 제한된 횟수의 업데이트로 얼마나 실현하는지 측정하는 절차입니다. 목표 구성 단계에서 얻은 개선량과 실제 fitting 이후의 개선량을 분리해, 보상 신호가 모델에 전달되는 정도를 따로 평가할 수 있습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.