용어 해설
- 지각적 감독(Perceptual Supervision)
- — 사전학습된 시각 표현기(예: VGG, DINOv2)의 특징 공간에서 예측 오차를 측정하는 손실 방식으로, 픽셀 거리 대신 의미적 거리를 최소화하여 시각적 왜곡(블러 등)보다 실제 유사한 모드에 근접한 출력을 선호하도록 학습시킨다.
- 흐름 매칭(Flow Matching)
- — 노이즈와 데이터 사이의 연속적 변환을 학습하는 프레임워크로서, 시간별 목표 속도(velocity)를 회귀하여 노이즈에서 깨끗한 샘플로의 역변환을 계산하고 샘플링할 때 이 속도 예측을 이용해 복원한다.
- VAE 잠재공간(VAE Latent Space)
- — 사전학습된 VAE의 잠재벡터 공간으로서 흐름 매칭 기존 방법은 이 공간에서 속도 회귀를 수행했으며 이 공간에서의 평균 회귀가 고단계 노이즈에서 블러를 유발하는 원인으로 지적되었다.
- 무분류기 가이드(Classifier-Free Guidance)
- — 조건부 및 무조건부 모델 예측을 선형 결합하여 조건 일치성을 강화하는 기법으로서, 일반적으로 추론 시 추가 무조건 예측 연산을 필요로 하나 논문에서는 학습 중에 이를 모델 내부로 흡수하는 방법을 제안한다.
- 오프-매니폴드 페널티(Off-Manifold Penalty)
- — 특정 특징 공간에서 데이터 모드 사이의 평균(중간값)이 실제 데이터 매니폴드에서 얼마나 멀어지는지를 수치화한 척도로서 값이 클수록 평균화된 블러가 더 큰 벌점을 받아 모드 지향 예측을 유도한다.
코드 예제
# PFM
v_pred = model(x_t, t, c)
x0_pred = velocity_to_x0(v_pred, x_t, t)
loss = perceptual_loss(decode(x0_pred), decode(x0))
# PFM with prediction side CFG baking
v_pred = model(x_t, t, c)
v_uncond = model(x_t, t, null)
v_pred = beta * v_pred + (1 - beta) * stopgrad(v_uncond)
x0_pred = velocity_to_x0(v_pred, x_t, t)
loss = perceptual_loss(decode(x0_pred), decode(x0))이 코드는 PFM 학습 루프의 핵심 연산을 단순화한 의사코드로서 노이즈 상태 x_t에서 모델 예측을 받아 깨끗한 샘플 예측을 복원하고 디코더와 사전학습된 특징추출기에 기반한 지각적 손실을 계산하는 과정을 보여준다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.







