본문으로 건너뛰기

JLT: Latent Diffusion Transformer에서의 Clean-Latent 예측

고정된 FLUX.2 VAE 잠재 표현에서 타깃 예측의 기하학적 차이가 학습 난이도와 생성 품질에 직접 영향을 준다. x, ϵ, v 간의 선형적 관계가 존재하나 finite-capacity 모델은 타깃의 기하학에 따라 회귀 문제의 난이도와 샘플링 효율이 다르게 나타난다. 이 연구는 latent diffusion에서도 타깃 지향이 단순한 algebraic 재표현이 아님을 보이며, 동일 표현 공간에서의 예측 타깃 설계가 성능에 큰 차이를 만든다는 점을 제시한다.

용어 해설

타깃 기하학(Target Geometry)
잠재 공간에서의 타깃 기하학은 신경망이 학습하는 목표 분포의 모양을 의미한다. x(clean latent), ϵ(noise), v(x−ϵ) 간의 선형적 관계가 존재하더라도 finite-capacity 모델은 각 타깃에 따라 오차 분포와 학습 난이도가 달라진다. 이로 인해 동일한 표현 공간에서도 학습 효율과 샘플링 속도가 달라지며, 본 연구는 latent 공간에서의 타깃 선택이 성능 차이에 직접 기여함을 보인다.
로컬 가우시안 근사(Local Gaussian Approximation)
데이터 분포를 로컬한 선형-가우시안 근사로 가정하고 공분산 스펙트럼을 해석한다. 이 근사는 x의 공분산 Σ를 통해 고변량 방향과 저변량 방향을 구분하고, 타깃(yx, yε, yv)의 조건부 분산 차이를 도출하는 기초가 된다.
등방성 공분산 바닥(Isotropic Covariance Floor)
_velocity 타깃은 모든 방향에 대해 단위 분산의 등방성 바닥을 추가하는 효과를 준다. 고유 방향의 분산이 작을수록 clean 타깃은 이를 억제하고, velocity 타깃은 저분산 방향까지 영향력을 확장한다는 점이 분석된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 26.수집 2026. 05. 28.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.