용어 해설
- 온폴리시 자기 증류(On-Policy Self-Distillation)
- — 현재 학습 중인 정책이 실제로 생성한 궤적을 학습 자료로 삼아 자기 자신을 갱신하는 방식입니다. DiffusionOPSD에서는 고정된 행동 정책이 생성한 상태와 기준점을 이용해 보상 기반의 중간 예측 목표를 만들고, 학습 정책이 이를 맞추도록 업데이트합니다.
- 종단 보상(Endpoint Reward)
- — 생성 과정의 마지막 이미지에 대해 품질이나 선호도를 평가하는 보상입니다. 중간 denoising 단계의 예측을 직접 지정하지 않으므로, 보상 신호를 중간 단계의 학습 목표로 변환하는 추가 절차가 필요합니다.
- Denoising 예측(Denoising Prediction)
- — 확산 모델이 현재 noisy 상태에서 깨끗한 출력 또는 다음 복원 방향을 예측하는 값입니다. 이 논문에서는 reward gradient를 이용해 기준점 주변의 양·음의 목표를 만들고, 해당 예측을 직접 학습시키는 감독 신호로 사용합니다.
- 행동 정책(Behavior Policy)
- — 현재 학습 데이터를 생성하는 고정된 확산 정책입니다. 각 외부 반복에서 trajectory와 query state, anchor를 공급하며, 학습 정책의 업데이트가 끝난 뒤 exponential moving average로 새 상태를 반영합니다.
- 보상 gradient(Reward Gradient)
- — 생성된 이미지의 보상이 변하는 방향을 나타내는 미분 신호입니다. DiffusionOPSD는 이 신호를 기준점 주변의 제한된 positive target과 negative target으로 바꾸어 image-level 보상을 중간 denoising 예측의 학습 목표로 변환합니다.
- 유한 fitting(Finite Fitting)
- — 새로 만든 목표를 학습 정책이 한 번 또는 제한된 횟수의 업데이트로 얼마나 실현하는지 측정하는 절차입니다. 목표 구성 단계에서 얻은 개선량과 실제 fitting 이후의 개선량을 분리해, 보상 신호가 모델에 전달되는 정도를 따로 평가할 수 있습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

