본문으로 건너뛰기

정적 Fréchet 손실의 허점을 보완하는 AdvFD

AdvFD는 whitening을 적용한 적대적 feature 공간으로 one-step 이미지 생성의 Fréchet 해킹을 줄인다.

왜 중요한가

FD-Loss는 Inception, SigLIP, MAE 같은 고정된 feature 공간의 Fréchet 거리를 줄이지만, 특정 공간이 놓치는 artifact를 남긴 채 학습 지표만 개선할 수 있다. AdvFD는 현재 생성 분포와 실제 분포의 잔여 차이를 찾아내도록 representation을 적대적으로 갱신하고, real-feature whitening으로 feature 크기만 키우는 편법을 막아 one-step 생성 품질과 다른 평가 공간의 정렬을 함께 개선한다.

핵심 기여

정적 feature 공간의 Fréchet 해킹 규명

고정된 pretrained representation을 최적화하면 학습에 사용한 FD-r-Inception은 29.4% 낮아지는 동안 사용하지 않은 FD-r-CLIP은 8.5% 높아질 수 있다. Inception FID를 3.31에서 2.56으로 낮추는 universal perturbation에서도 눈에 보이는 고주파 artifact가 남아 정적 metric의 blind direction을 확인한다.

적대적으로 학습하는 Fréchet representation

AdvFD는 SigLIP, MAE, Inception으로 구성한 static Fréchet objective에 학습 가능한 representation을 추가한다. adversarial representation은 실제 샘플과 생성 샘플의 Fréchet discrepancy를 키워 고정 encoder가 놓친 차이를 드러내고, generator는 같은 discrepancy를 줄이는 방향으로 갱신된다.

Real-feature whitening을 통한 안정화

학습 가능한 representation의 feature norm이 커지면 실제 분포와 생성 분포의 차이를 새 정보 없이 키울 수 있다. AdvFD는 실제 feature의 평균과 공분산으로 representation을 whitening해 전역적인 feature rescaling만으로 adaptive Fréchet discrepancy를 증가시키는 경로를 억제한다.

다양한 backbone과 규모에서의 성능 개선

ImageNet-1K 256 × 256 class-conditional generation에서 AdvFD는 JiT와 pMF의 B, L, H 규모 모델에 적용됐다. JiT-L에서는 FID 0.77/0.73, FD-r6 3.24/2.01, FD-r3 5.46/3.20으로 FD-Loss 대비 세 지표를 모두 낮췄다.

핵심 아이디어 이해하기

기존 FD-Loss는 실제 이미지와 생성 이미지의 feature를 pretrained encoder로 바꾼 뒤 평균과 공분산을 비교한다. 이 방식은 paired target 없이 분포 수준의 학습 신호를 만들지만, encoder가 감지하지 못하는 texture나 구조 차이는 generator에 약하게 전달된다. 따라서 generator가 특정 feature 통계만 맞추고 사람이나 다른 encoder가 알아채는 artifact를 남길 수 있다.

AdvFD는 이 고정된 비교 공간에 generator의 현재 상태에 맞춰 변하는 adversarial representation을 더한다. generator가 noise를 이미지로 바꾸면 static representation과 adaptive representation에서 실제·생성 feature 분포의 Fréchet discrepancy를 계산하고, G-step에서는 두 discrepancy를 줄이도록 generator를 갱신한다. 이어 D-step에서는 generator를 고정한 채 representation을 갱신해 아직 남은 discrepancy가 더 크게 드러나는 feature 공간을 찾는다.

이 적대적 갱신은 단순히 feature의 숫자 크기를 키우는 방식으로도 discrepancy를 증가시킬 수 있다. 실제 feature의 평균을 빼고 공분산으로 whitening하면 feature scale과 covariance geometry가 실제 분포를 기준으로 정규화되므로, representation은 크기 증폭보다 실제·생성 분포의 구조적 차이를 반영하는 방향으로 학습된다.

결과적으로 static branch는 pretrained feature 공간의 안정적인 기준을 유지하고 adaptive branch는 generator가 바뀔 때마다 새로운 blind spot을 찾는다. 이 구조는 한 번의 sampling으로 생성하는 JiT와 pMF에 추가적인 sampling 단계를 요구하지 않으면서, 학습에 사용하지 않은 ConvNeXt, DINOv2, CLIP 기반 FD-r3에서도 분포 정렬을 개선한다.

방법론

AdvFD는 실제 데이터 분포를 p, generator Gθ가 만드는 분포를 qθ, 고정 representation 집합을 ℱ로 둔다. SigLIP, MAE, Inception에서 계산한 Fréchet 거리의 가중합을 D_static으로 만들고, pretrained visual encoder에서 초기화한 trainable representation ψω의 whitening된 feature로 D_adv를 계산한다. G-step에서는 ψω와 ℱ를 고정한 뒤 Dstatic(p,qθ)+λadvDadv(p,qθ;ωt)D_{static}(p,q_θ)+λ_{adv}D_{adv}(p,q_θ;ω_t)를 최소화해 generator 파라미터 θ를 갱신한다.

D-step에서는 갱신된 generator를 freeze하고 생성 샘플을 computational graph에서 분리한다. adaptive discrepancy를 representation 파라미터 ω로 미분한 gradient를 구한 뒤 gradient norm을 threshold τ로 clipping하고, AdamW를 사용해 D_adv가 증가하는 방향으로 ω를 갱신한다. 이 과정은 실제 feature와 생성 feature의 평균·공분산 차이를 더 잘 드러내는 비교 공간을 선택하며, G-step과 D-step을 번갈아 수행하는 min-max 구조를 이룬다.

Raw feature로 Fréchet 거리를 계산하면 representation을 c배 키울 때 거리가 c²배가 되는 scale direction이 생긴다. AdvFD는 실제 feature의 평균 μ와 공분산 Σ를 사용해 (ψω(x)μ)(Σ+εI)1/2(ψ_ω(x)-μ)(Σ+εI)^{-1/2}로 whitening하며, ε는 분산이 작은 방향의 수치적 불안정을 완화한다. 입력 feature에서 실제 통계를 빼고 공분산 역제곱근을 곱한 뒤 생성 feature의 분포 차이를 계산하므로, 전역 rescaling만으로 D_adv를 키우기 어렵다.

실험은 ImageNet-1K의 256 × 256 class-conditional generation에서 진행했고, JiT와 pixel MeanFlow(pMF)의 B, L, H 규모를 같은 checkpoint, data, global batch size, optimization budget, sampling configuration으로 비교했다. 각 one-step 모델은 동일한 설정으로 50,000개 샘플을 생성했으며, FID와 여섯 representation의 평균 정렬을 반영하는 FD-r6, 학습에 사용하지 않은 ConvNeXt·DINOv2·CLIP을 평가하는 FD-r3를 사용했다. 모든 지표는 낮을수록 실제 분포와의 차이가 작다.

관련 Figure

AdvFD의 G-step과 D-step에서 generator와 adversarial representation을 번갈아 갱신하는 min-max 학습 흐름을 나타낸 다이어그램이다.
Diagram

G-step에서는 generator Gθ가 noise에서 fake batch를 만들고 static representation과 adversarial representation이 모두 고정된 상태에서 두 Fréchet discrepancy의 가중합을 줄인다. D-step에서는 generator를 고정하고 adversarial representation ψ를 갱신해 real feature와 fake feature를 더 멀어지게 하며, static representation은 계속 기준점으로 남는다. 아래의 분포 그림은 G-step이 두 분포를 가깝게 만들고 D-step이 남은 차이를 드러내도록 밀어내는 교대 구조를 나타낸다.

AdvFD의 G-step과 D-step에서 generator와 adversarial representation을 번갈아 갱신하는 min-max 학습 흐름을 나타낸 다이어그램이다.

주요 결과

JiT-B에서 AdvFD는 FD-Loss 대비 FID를 1.00에서 0.79로, FD-r6를 5.53에서 3.92로, FD-r3를 8.45에서 6.03으로 낮췄다. 이는 각각 21.0%, 29.1%, 28.6%의 상대 개선이며, 학습에 포함되지 않은 representation에서도 개선이 이어졌다. JiT-L에서는 FID 0.77에서 0.73, FD-r6 3.24에서 2.01, FD-r3 5.46에서 3.20으로 바뀌어 FD-r6와 FD-r3의 개선폭이 38.0%와 41.4%였다.

JiT-H에서도 FID 0.75에서 0.72, FD-r6 2.65에서 1.80, FD-r3 4.44에서 2.93으로 낮아졌다. 이는 각각 4.0%, 32.1%, 34.0%의 상대 개선으로, generator 규모가 커져도 adaptive representation의 효과가 유지됨을 수치로 뒷받침한다. pMF에서도 모든 규모에서 세 지표가 개선됐고, pMF-H는 FID 0.77에서 0.74, FD-r6 1.89에서 1.74, FD-r3 2.69에서 2.50으로 바뀌었다.

정성 비교에서 JiT-L과 pMF-L의 AdvFD 샘플은 FD-Loss보다 object structure가 더 일관되고 texture가 깨끗하며 local artifact가 적었다. PatchGAN을 추가한 FD-Loss는 FID 0.90을 얻었지만 FD-r6 5.57과 FD-r3 8.90으로 기준선보다 나빠졌고, DMD 방식은 FID 1.77과 FD-r6 5.90을 기록했다. 반면 AdvFD는 FID 0.79, FD-r6 3.92, FD-r3 6.03을 기록해 세 지표를 함께 낮췄다.

Whitening을 제거하면 FID 10.69, FD-r6 58.50, FD-r3 40.54로 성능이 크게 악화됐다. adaptive branch의 pre-whitening RMS norm은 whitening이 없을 때 frozen reference 대비 수자릿수 커졌지만, whitening을 적용하면 훨씬 낮고 안정적으로 유지됐다. Inception으로 초기화한 adaptive representation이 FID 0.79, FD-r6 3.92, FD-r3 6.03으로 가장 좋았고, random Inception은 0.85, 5.69, 7.63을 기록했다.

관련 Figure

JiT-L과 AdvFD의 생성 이미지 비교 및 JiT-L·JiT-H에서 FD-r3와 FD-r6가 감소한 막대그래프를 함께 배치한 그림이다.
Chart

왼쪽 비교에서는 AdvFD가 JiT-L의 static FD-Loss 결과보다 더 깨끗한 texture와 일관된 구조를 산출하는 장면을 보여준다. 아래 그래프에서 JiT-L은 FD-r3가 5.46에서 3.20으로 41.4%, FD-r6가 3.24에서 2.01로 38.0% 낮아졌다. JiT-H에서도 FD-r3는 4.44에서 2.93으로 34.0%, FD-r6는 2.65에서 1.80으로 32.1% 낮아져 모델 규모가 커진 뒤에도 held-out representation 정렬이 유지된다.

JiT-L과 AdvFD의 생성 이미지 비교 및 JiT-L·JiT-H에서 FD-r3와 FD-r6가 감소한 막대그래프를 함께 배치한 그림이다.

JiT-L과 pMF-L에서 FD-Loss와 AdvFD가 생성한 동물·풍경 이미지의 정성적 차이를 나란히 비교한 그림이다.
Screenshot

JiT-L 비교에서 AdvFD 샘플은 FD-Loss 샘플보다 동물의 형태와 배경 구조가 더 일관되고 일부 local artifact가 줄어든 모습을 보인다. pMF-L 비교에서도 물고기, 닭, 백조, 타조의 texture와 윤곽이 AdvFD 쪽에서 더 안정적으로 나타난다. 이 그림은 수치 지표의 개선이 이미지 구조와 texture의 시각적 변화로도 이어진다는 결과를 보완한다.

JiT-L과 pMF-L에서 FD-Loss와 AdvFD가 생성한 동물·풍경 이미지의 정성적 차이를 나란히 비교한 그림이다.

기술 상세

AdvFD의 static objective는 고정 visual representation 집합 ℱ에 대해 Dstatic(p,qθ)=ϕFλϕDFDϕ(p,qθ)D_{static}(p,q_θ)=\sum_{ϕ∈ℱ}λ_ϕD_{FD}^{ϕ}(p,q_θ)로 계산한다. p는 real data distribution, qθ는 generator Gθ가 유도한 distribution, λϕ는 representation별 가중치이며, 실제·생성 샘플을 각 encoder에 통과시켜 얻은 feature의 평균과 공분산으로 Fréchet discrepancy를 산출한다. G-step에서는 adaptive weight λadv를 곱한 D_adv를 static objective에 더해 generator가 두 종류의 분포 차이를 동시에 줄인다.

D-step은 generator를 고정하고 gt=ωDadvg_t=∇_ωD_{adv}를 계산한 뒤 ωt+1=ωt+ηDgtmin(1,τ/gt2)ω_{t+1}=ω_t+η_Dg_t\min(1,τ/\lVert g_t\rVert_2)로 representation을 갱신한다. 여기서 ηD는 representation learning rate, τ는 gradient-norm clipping threshold이며, gradient norm이 τ보다 크면 방향은 유지하고 크기만 τ로 제한한다. 예를 들어 gradient norm이 2τ이면 clipping 후 update 방향의 norm은 τ가 되어, discrepancy를 키우려는 adversarial update가 한 번에 과도하게 이동하지 않는다.

Adaptive representation의 whitening은 실제 feature 평균 μpψ와 공분산 Σpψ를 사용해 ψˉω(x)=(ψω(x)μpψ)(Σpψ+εI)1/2\bar{ψ}_ω(x)=(ψ_ω(x)-μ_p^ψ)(Σ_p^ψ+εI)^{-1/2}로 정의한다. x를 representation에 넣고 실제 batch의 평균을 뺀 다음 regularizer εI가 더해진 공분산의 역제곱근을 곱해, 실제 feature 공간의 평균을 0에 가깝게 하고 covariance scale을 정규화한다. 이 처리는 representation을 c배 키워도 실제 통계도 함께 변하므로 adaptive FD가 단순히 c²배 커지는 현상을 줄인다.

AdvFD의 Fréchet term은 representation feature의 평균과 공분산으로 만든 두 Gaussian의 squared Wasserstein-2 distance다. WGAN처럼 scalar critic이 각 sample에 점수를 주는 대신, AdvFD는 ψω가 sample을 feature vector로 매핑하고 그 feature 통계가 비교되는 geometry 자체를 학습한다. 따라서 inner update는 고정된 input-space transport cost에서 scalar score를 조정하는 방식이 아니라, 현재 generator가 놓친 차이가 feature 통계에 드러나도록 comparison space를 재가중하는 방식이다.

실험에서 static representation은 SigLIP, Inception, MAE의 SIM 조합으로 고정했고, adversarial branch는 SigLIP 또는 MAE에 rank-16 LoRA를 적용하거나 Inception을 full Fine-tuning해 초기화했다. pretrained Inception 초기화는 기본 시각 feature가 이미 형성된 상태에서 residual discrepancy에 집중하게 해 가장 낮은 지표를 얻었고, random initialization은 low-level shortcut으로 FD를 키우기 쉬웠다. 같은 Inception branch를 frozen 상태로 추가하면 지표가 악화됐지만 trainable 상태로 바꾸면 개선되어, 문제의 핵심이 encoder architecture보다 representation의 staticity에 있음을 확인했다.

관련 Figure

Whitening을 사용하지 않은 생성 이미지의 품질 저하와 whitening 유무에 따른 adaptive·reference feature RMS norm 비율을 나타낸 그림이다.
Chart

왼쪽에서는 whitening 없이 학습한 결과에서 이미지가 흐려지거나 구조가 무너지는 등 생성 품질이 크게 떨어지는 사례를 보여준다. 오른쪽 로그 스케일 그래프에서는 whitening을 사용하지 않을 때 RMS norm ratio가 10³에서 10⁵ 수준까지 크게 치솟지만, whitening을 사용하면 대체로 10¹에서 10² 범위에 머문다. 실제 feature의 평균과 공분산으로 adaptive representation을 정규화하면 adversarial branch가 feature scale만 키워 D_adv를 증가시키는 경로를 억제할 수 있다는 점을 시각적으로 뒷받침한다.

Whitening을 사용하지 않은 생성 이미지의 품질 저하와 whitening 유무에 따른 adaptive·reference feature RMS norm 비율을 나타낸 그림이다.

실무 활용

AdvFD는 이미 학습된 one-step image generator의 post-training objective에 추가하는 방식으로 사용할 수 있다. 기존 FD-Loss의 static representation을 유지하면서 adversarial representation과 whitening branch를 번갈아 학습하므로, sampling budget을 늘리지 않고 target encoder와 held-out encoder의 분포 정렬을 함께 평가할 수 있다.

  • ImageNet과 같은 class-conditional image generator의 one-step post-training에서 FD-Loss의 정적 feature 최적화를 보완하는 경우
  • JiT 또는 pMF backbone에서 FD-r3처럼 학습에 사용하지 않은 encoder의 분포 정렬까지 확인하려는 경우
  • adversarial representation 학습 중 feature norm inflation과 불안정한 min-max optimization을 억제하려는 경우

코드 공개 여부: 비공개

키워드

Fréchet Distance(분포 수준 거리)Fréchet Hacking(정적 feature 공간 편향)AdvFD(적대적 Fréchet 거리)Real-feature Whitening(실제 feature 정규화)One-step Generation(단일 단계 생성)Min-max Optimization(번갈아 수행하는 최적화)

용어 해설

Fréchet 거리(Fréchet Distance)
Fréchet Distance는 실제 이미지와 생성 이미지에서 추출한 feature 분포의 차이를 측정하는 지표다. 각 분포의 평균과 공분산을 비교해 분포 수준의 불일치를 계산하며, 생성 모델의 시각적 품질과 데이터 분포 정렬 정도를 평가하거나 학습하는 데 활용된다.
Fréchet 해킹(Fréchet Hacking)
Fréchet Hacking은 생성 모델이 특정 pretrained encoder의 Fréchet 점수만 낮추면서 사람이 인지하는 artifact나 다른 encoder에서 드러나는 분포 차이를 남기는 현상이다. 고정된 feature 공간의 blind direction을 이용해 proxy metric을 개선하지만 실제 이미지 품질은 악화될 수 있다.
Feature Whitening
Feature Whitening은 feature에서 실제 데이터의 평균을 빼고 공분산으로 정규화하는 처리다. AdvFD에서는 adversarial representation이 feature 크기만 키워 Fréchet discrepancy를 부풀리는 경로를 차단하고, 실제 feature의 scale과 covariance geometry를 기준으로 비교하도록 만든다.
One-step Generator
One-step Generator는 한 번의 function evaluation으로 noise를 이미지로 변환하는 생성 모델이다. 다단계 diffusion sampling보다 적은 sampling cost로 이미지를 생성하지만, post-training 단계에서 분포 정렬과 세부 품질을 동시에 개선하기 어려워 AdvFD의 평가 대상이 된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 11.수집 2026. 08. 13.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.