본문으로 건너뛰기

Diffusion Transformers에서의 Cross-Layer 정보 라우팅 재고

Diffusion Transformers의 잔차 흐름은 여전히 고정된 합산으로 구성되어 깊은 층에서의 정보 전달이 비효율적이다. DAR은 timestep에 따라 가중치를 학습하는 라우팅을 도입해 PreNorm dilution과 gradient 흐름의 비대칭, 블록 간 중복 문제를 완화한다. 이로써 학습 속도와 최종 품질이 함께 개선될 수 있다.

용어 해설

크로스-레이어 라우팅(Cross-Layer Routing)
딥 뉴럴 네트워크에서 서로 다른 층들 간에 정보를 주고받는 방식에 관한 일반적 용어로, DiTs의 잔차 스트림에서 층 간 정보의 흐름을 동적으로 조정하는 문제를 다룬다.
PreNorm dilution
Residual stream의 Magnitude 증가로 인해 노멀라이제이션(PreNorm) 이후 각 층의 출력이 점점 확산되듯 커지는 현상으로, 깊은 DiT에서 정보 손실과 gradient 흐름 불균형을 초래한다.
블록 단위 중복(Block-wise redundancy)
연속된 Transformer 블록 간 표현이 유사하게 반복되어 계산 효율이 떨어지는 현상으로, 인접 블록의 출력이 서로 크게 달라지지 않는다.
Diffusion-Adaptive Routing (DAR)
DiT의 잔차 합산을 학습 가능한 softmax 가중합으로 대체하고, timesteps(t)에 따라 동적으로 라우팅을 조정하는 크로스-레이어 라우팅 방법.
REPA
Representation Alignment for diffusion transformers. 중간 은닉 상태를 pretrained 비주얼 인코더의 표현과 정렬하는 목표로 DiT의 학습 효율을 높이는 기법.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 20.수집 2026. 05. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.