본문으로 건너뛰기

DiffusionBench: ImageNet과 Text-to-Image를 연결하는 통합 훈련 프레임워크 NanoGen을 통한 DiT(디퓨전 트랜스포머) 전방위 평가

Diffusion transformer(DiT) 연구는 ImageNet FID 중심으로 수렴했으나, 이 점수가 텍스트-투-이미지(T2I) 성능을 예측하는지 불확실하다. NanoGen으로 동일한 코드·레시피로 ImageNet과 T2I를 모두 학습·평가하면 ImageNet 개선이 T2I 개선으로 일반화되지 않음을 확인하고, 두 축을 합친 DiffusionBench를 제안할 수 있다.

용어 해설

분류기-프리 가이던스(Classifier-Free Guidance (CFG))
조건 입력과 무조건 입력을 무작위로 섞어 샘플링 시 가이던스 스케일을 적용해 생성 품질과 다양성의 절충을 조절하는 기술이다. 모델 출력에 조건과 비조건 예측을 선형 결합해 최종 샘플을 얻으며, 가이던스 스케일이 크면 조건 일치성이 증가하고 다양성은 감소한다.
잠재 공간 확산(Latent Diffusion)
사전학습된 VAE나 인코더로 이미지를 저차원 잠재공간으로 변환한 뒤 그 공간에서 확산 과정을 학습하는 방법이다. 픽셀 직접 처리 대비 연산·메모리 비용을 줄여 고해상도 학습을 실현한다.
표현 오토인코더 (RAE)(Representation Autoencoder (RAE))
사전학습된 비동결(또는 고정) 비전 인코더의 출력 표현을 토크나이저로 사용해 디퓨전 모델이 그 표현을 재생성하도록 학습하는 방식이다. 고수준 의미 구조를 보존하는 잠재가 생성 수렴 속도를 높인다.
표현 정렬 (REPA)(REPA (representation alignment))
DiT 내부 표현을 미리 학습된 비전 인코더의 내부 특성과 정렬시키는 기법이다. 이 정렬 신호를 활용해 VAE와 DiT를 end-to-end로 함께 튜닝하면 학습 안정성과 품질 향상이 관찰된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 23.수집 2026. 06. 25.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.