본문으로 건너뛰기

Representation Distribution Matching을 통한 원스텝 이미지 생성

한 번의 네트워크 평가로 이미지를 생성하는 one-step 모델은 추론 시간이 큰 제약인 multi-step 확산계열과는 다른 실용적 이점을 제공한다. 이 논문은 frozen pretrained encoder의 특징 분포를 직접 정합하는 RDM 패러다임을 체계화하여 MMD 기반 추정과 표현 선택의 설계 공간을 밝히고 실제 ImageNet 원스텝 성능을 크게 끌어올렸다. 평가 지표 SW_r14과 인간선호 프록시 PickScore를 통해 학습 손실과 독립적인 품질 향상을 입증했다.

용어 해설

최대 평균 차이(MMD)
두 확률분포의 차이를 커널 기반 평균 임베딩 차이로 측정하는 거리로, 본문에서는 Gaussian kernel을 사용해 인코더 특징 공간에서 생성 분포와 실제 분포를 정량화하고 학습 신호로 활용했다.
나이스트롬 근사(Nyström)
대규모 데이터의 커널 평균 임베딩을 소수의 랜드마크로 압축해 참조 평균을 고정시킨 기법으로, 본문에서는 4096개 랜드마크로 전체 1.28M 이미지의 참조 임베딩을 한 번만 계산해 attraction 항에 사용했다.
슬라이스드-워서스타인 거리(Sliced-Wasserstein)
고차원 분포 거리를 여러 1차원 투영의 Wasserstein 거리 평균으로 근사하는 최적 수송 계열 거리로, 본문에서는 독립적 평가 지표 SW_r14로 여러 인코더에 대해 비편향적 검증을 제공했다.
표현 분포 정합(Representation Distribution Matching)
사전학습된 고정 인코더의 특징 공간에서 생성물과 실제 데이터의 특징 분포를 직접 정합하는 패러다임으로, 본문에서는 MMD 기반 손실과 고정 참조를 결합해 one-step 생성기를 학습시켰다.
그래디언트 캐싱(Gradient Caching)
매 스텝 거대한 생성 배치를 메모리 제약 없이 처리하기 위해 배치를 청크로 나누어 각 청크의 정확한 그래디언트를 축적한 뒤 합산하는 기법으로, 본문에서는 대형 배치 N=5120/10240을 가능하게 했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 02.수집 2026. 07. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.