본문으로 건너뛰기

RT-Lynx: Diffusion Transformers에서 GEMM Sparsity를 Activation으로 옮겨 실현하는 방법

Diffusion Transformer(DiT) 계열 모델의 추론 비용은 높은 편이다. 가중치 중심의 sparsification은 성능 저하를 야기하는 반면, Activation sparsity는 본질적으로 더 희소한 패턴을 만들고 품질 손실을 크게 줄인다. RT-Lynx는 Activation sparsity를 online으로 적용하고 Norm Compensation 및 LoRA 보정으로 품질 저하를 억제하며, CUDA 기반의 엔드투엔드 파이프라인으로 실사용 속도 향상을 달성한다.

용어 해설

N:M 희소성(N:M sparsity)
고정된 로컬 N:M 패턴으로 각 계층의 출력에서 N개의 비제로 원소만 남기고 나머지를 0으로 설정하는 semi-structured sparsity 기법. 이를 통해 하드웨어에서의 처리 효율을 높이고 FLOPs를 대폭 감소시킬 수 있다.
Activation sparsity
토큰당 활성화되는 채널 수가 매우 작아지는 현상으로, DiT의 FFN에서 활성화가 주로 0에 가까운 값으로 분포하며 비제로 채널 수가 적다. 가중치 희소화보다 출력 오차가 작고 품질 저하가 완화된다.
Sparse Tensor Core
NVIDIA의 Semi-structured sparsity를 지원하는 전용 실행 경로로, 2:4와 같은 패턴의 연산을 하드웨어 차원에서 가속하고 nnz를 절반으로 줄이되 기억접근 패턴을 규칙적으로 유지한다.
Norm Compensation(Norm Compensation)
활성화 희소화로 인한 활성화 벡터의 L2 노름 감소를 보정하기 위한 방법으로, 희소화된 활성화를 dense 원래 활성화의 노름과 동일하게 만들기 위해 스케일링을 적용한다.
LoRA 어댑테이션(LoRA Adaptation)
희소 활성화로 인한 미세한 잔차 정보를 보완하기 위해 LoRA 매개변수 LA, LB를 도입해 저차원 어댑터를 학습시키는 방법. 주 모듈은 고정하고 LoRA 분기만 학습한다.
Diffusion TransformERs(Diffusion Transformers (DiT))
Diffusion 모델에 Transformer 모듈을 결합한 구조로, 고해상도 이미지 생성 품질과 확장성을 높이는 아키텍처이며 본 연구의 주 타깃 모델이다.

코드 예제

text
S(X) = s · X˜, s = (∥X∥2 / (∥X˜∥2 + ϵ))

activation sparsification에서 비제로 구성의 크기를 원래 활성화의 노름과 동일하게 보정하는 수식.

text
Y = Ys + Yr = S(X) · W⊤ + X · (LALB)⊤

활성화 기반 sparse 경로와 LoRA 보조 경로의 결합으로 최종 출력을 구성하는 수식.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 26.수집 2026. 05. 28.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.