TL;DR
텍스트 조건을 받아 이미지를 생성하는 최신 DiT 구조에서는 프롬프트 처리가 단순한 직렬 전달이 아니라 내부에서 토큰 간 라우팅과 저장을 거치며 이루어짐이 확인되었다. 이러한 내부 메커니즘을 밝히면 불필요한 계산을 제거하거나 모델의 조건화 방식 설계에 근거를 제공할 수 있다. 본 논문은 챗 템플릿 토큰이 입력 의미를 직접 갖지 않더라도 생성 과정에서 의미를 유지·전달하는 주요 계산적 슬롯으로 작동함을 증명했다.
왜 중요한가
텍스트 조건을 받아 이미지를 생성하는 최신 DiT 구조에서는 프롬프트 처리가 단순한 직렬 전달이 아니라 내부에서 토큰 간 라우팅과 저장을 거치며 이루어짐이 확인되었다. 이러한 내부 메커니즘을 밝히면 불필요한 계산을 제거하거나 모델의 조건화 방식 설계에 근거를 제공할 수 있다. 본 논문은 챗 템플릿 토큰이 입력 의미를 직접 갖지 않더라도 생성 과정에서 의미를 유지·전달하는 주요 계산적 슬롯으로 작동함을 증명했다.
핵심 기여
인과적 해석 프레임워크 도입
토큰 수준 어텐션 분해, 스팬 단위 조건화 개입, 트랙젝토리 간 헤드 이식, 층별 인과 마스킹을 결합한 프레임워크를 제안하여 디퓨전 트랜스포머 내부에서 언제 어디서 조건 정보가 읽히고 라우팅되며 저장되는지를 추적할 수 있게 했다.
챗 템플릿 토큰의 주목적 계산 위치 확인
인코더 출력에서는 프롬프트 특이적 의미를 거의 담지 않는 챗 템플릿 후행 토큰들이 이미지→텍스트(I2T) 어텐션에서 지배적인 싱크로 작동하며, 모델 내부에서 객체 정체성을 유지하는 암묵적 시맨틱 레지스터 역할을 수행함을 실험적으로 확인했다.
시맨틱 흐름의 간접성 규명
프롬프트 의미는 먼저 이미지 잠재(z)에 주입되고 그 후 이미지 스트림으로부터 템플릿 레지스터로 읽혀지며 템플릿 토큰이 직접 프롬프트 토큰을 읽어 의미를 얻는 것이 아님을 교차 이식 및 마스킹 실험으로 증명했다.
무학습 기반 헤드 프루닝 규칙 제안
이미지→프롬프트-의존적 어텐션이 큰 헤드들은 생성에 거의 인과적으로 기여하지 않으므로 이를 기준으로 말단 단계의 헤드를 잘라낼 수 있음을 보였고, 제안 규칙으로 어텐션 FLOPs를 20% 절감하면서 GenEval 정확도는 1.4점만 하락하는 실제 절감 효과를 제시했다.
핵심 아이디어 이해하기
텍스트-이미지 DiT는 텍스트 토큰과 이미지 잠재 토큰을 연결된 자기어텐션으로 함께 처리하되 쿼리와 키를 텍스트·이미지 구간으로 분할하면 이미지 쿼리가 텍스트 키를 참조하는 I2T 블록이 생성 조건을 전달하는 핵심 경로가 된다. 프롬프트는 통상적으로 의미를 담는 앞부분(semantic span)과 포맷용 후행 토큰(structural span)으로 나뉘며, 이 두 스팬이 실제로 생성 과정에서 같은 역할을 하는지는 정량적 개입이 필요했다. 본 연구는 I2T 블록의 attention mass를 측정하여 structural span이 반복적으로 이미지 쿼리의 주된 키 수신 위치가 됨을 발견했고, 이 현상이 단순 포맷 잔재가 아니라 내부 계산의 저장과 전달을 담당하는 레지스터 역할과 연결되어 있음을 핵심 직관으로 삼았다.
방법론
연구는 네 가지 실험적 도구를 결합했다. 첫째, 블록·헤드·타임스텝 단위의 포괄적 어텐션 분해를 통해 특정 키 스팬이 이미지 쿼리에서 얼마나 많은 어텐션 질량을 받는지 정량화했다. 둘째, 스팬 교체(cross-prompt swap)와 평균 템플릿 대입 실험으로 structural 토큰이 인코더 수준에서 의미를 얼마나 보유하는지를 평가했다. 셋째, 트랙젝토리 간 헤드 이식(progressive head transplant) 실험을 통해 어떤 헤드들이 실제로 객체 정체성 전파에 인과적으로 관여하는지를 테스트했다. 넷째, 레지스터 쿼리에서 특정 키 스팬(semantic tokens 또는 image latents)에 대한 어텐션을 층별로 마스킹하여 레지스터가 의미를 획득하는 경로와 시점을 규명했다.
관련 Figure

이 도식은 프레임워크가 다루는 네 가지 핵심 개입 기법을 시각적으로 정리하며, 특히 텍스트 측을 의미 스팬과 구조 스팬으로 분할해 I2T 경로를 중심으로 조사하는 실험 설계를 명확히 보여준다. 결과적으로 후속 실험들이 어떤 기준으로 헤드와 층을 선택하고 어떤 마스킹을 적용했는지의 논리적 근거를 제공한다.
제안한 인과 해석 프레임워크의 개요 다이어그램으로, 토큰 단위 어텐션 분해·스팬 개입·헤드 이식·층별 마스킹을 결합해 정보의 읽기·라우팅·저장 경로를 추적하는 흐름을 보인다.
주요 결과
단순 프롬프트 'An apple'에서 Qwen-Image 계열의 상위 싱크 헤드 하나는 structural 스팬에 대해 m_R = 0.998에 달하는 강한 집중을 보였고, 모델 수준 평균으로 Qwen-Image에서 구조적 스팬은 m̄_R = 0.23을 차지한 반면 의미적 스팬은 m̄_S = 0.020으로 약 11×의 스팬 레벨 격차가 관찰되었다. 대규모 벤치마크(GenEval, DPG-Bench, Qwen-Image-Bench)에서도 구조적 토큰이 I2T 어텐션의 다수를 흡수하는 현상이 보편적으로 유지되었고, 길고 복잡한 프롬프트에서는 스팬 합의 역전이 일어나더라도 토큰당 평균 비율은 유지되었다. 이식·마스킹 실험에서는 semantic-span을 많이 읽는 헤드들을 먼저 이식해도 정체성이 전환되지 않았고 오히려 무조건적 기본 출력으로 수렴하는 반면, 구조적 레지스터와 연관된 헤드들을 이식하면 약 18%의 헤드 이식만으로 객체가 전환되어 읽기와 유지가 분리된 인과적 메커니즘이 드러났다. 이 관찰을 이용한 무학습 헤드 프루닝에서 K=360를 무작위로 잘라내면 조인트 어텐션 FLOPs의 20%가 제거되며 GenEval 정확도는 76.1에서 74.7로 1.4점만 감소했으나 지각적 품질 지표(LPIPS 등)는 더 민감하게 하락하였다.
관련 Figure

이 3D 시각화는 이미지 쿼리에서 텍스트 키로 흘러가는 어텐션 분포를 블록·헤드 관점에서 직관적으로 보여주며, 구조적 스팬이 반복적으로 높은 질량을 흡수해 싱크 역할을 함을 시각적으로 확인시킨다. 또한 시간·블록·헤드 전반에서 특정 구조적 구분자 토큰(<|im_end|>)이 단일 최대 흡수점으로 등장하는 수치 관찰을 보강한다.
프롬프트 'An apple'에 대한 상위 싱크 헤드들의 3D 어텐션 표면을 시각화한 그림으로, 구조적 토큰 스팬 위에 뚜렷한 능선 형태의 집중이 나타난다.

그림은 semantic-span에 많이 의존하는 헤드를 먼저 이식했을 때 정체성이 전환되지 않고 기본 출력으로 수렴하는 반면, 레지스터 연관 헤드를 이식하면 적은 비율의 헤드 교체만으로 객체가 전환되는 현상을 정성적으로 드러낸다. 또한 ℛ→ℐ 어텐션을 마스킹하면 초기에 객체가 빠르게 지워지는 반면 ℛ→𝒮 마스킹은 큰 영향을 주지 않는다는 실험적 분기점을 보강한다.
점진적 전체-헤드 이식과 점진적 어텐션 마스킹 실험의 정성적 생성 결과를 보여주는 그림으로, 특정 이식 순서가 객체 정체성 전환을 유발함을 시각적으로 제시한다.
기술 상세
분석 대상 모델은 Qwen-Image 계열의 dual-stream MMDiT 아키텍처로, 각 블록에서 텍스트와 이미지 토큰이 별도 파라미터로 처리되지만 단일 공동 attention 스트림을 통해 상호작용한다. 공동 attention 행렬 A^{(l,h)}는 합쳐진 시퀀스 [c; z] 위에서 계산되며, 이미지 쿼리 그룹 ℐ가 텍스트 키 스팬(semantic 𝒮, structural ℛ)에 할당하는 질량 m_{K}^{(l,h)}( ext{ℐ})를 블록·헤드·타임스텝 평균으로 집계해 I2T 경로의 기여를 정량화했다. 정밀 실험에서는 특정 쿼리 그룹에서의 단일 키 토큰 j에 대한 질량 m_j^{(l,h)}과 스팬 합 m_{\mathcal{R}}^{(l,h)}, m_{\mathcal{S}}^{(l,h)}을 비교하여 싱크 현상을 수치적으로 표현했다.
한계점
평균 템플릿으로 대체할 경우 일부 프롬프트에서 생성물이 기본 무조건 분포, 예컨대 사람 초상으로 수렴하는 예외가 관찰되었으며 이는 학습 데이터의 무조건 편향을 반영하는 것으로 보인다. 제안된 후반 단계 헤드 프루닝은 GenEval 정확도를 상대적으로 잘 보존했으나 LPIPS 등의 지각적 품질 지표는 더 민감하게 하락하여 시각적 품질을 중시하는 애플리케이션에서는 주의가 필요하다. 본 연구의 분석은 Qwen-Image 계열과 일부 체크포인트에서 주로 평가되었으며, 다른 아키텍처와 학습 설정으로의 일반화는 추가 검증이 필요하다.
실무 활용
연구 결과는 학습 과정을 거치지 않고도 실행 시점에서 헤드를 선별적으로 비활성화하여 추론 비용을 실질적으로 절감할 수 있음을 보였다. 특히 이미지→의미적 어텐션이 큰 헤드들을 후반 단계에서 제거하는 규칙은 프롬프트에 독립적으로 적용 가능하며 GenEval 정확도 기준에서 경미한 성능 저하로 상당한 FLOPs 절감을 달성했다. 코드는 공개되어 있어 연구 결과를 재현하고 운영 환경에서 효율화 규칙을 시험할 수 있다.
- 대규모 DiT 모델의 추론 비용 절감 및 응답 시간 단축을 위한 실험적 프루닝 적용
- 모델의 내부 조건화 경로를 진단하고 특정 헤드·층이 생성 품질에 미치는 인과적 영향 평가
- 디버깅과 안전성 분석에서 챗 템플릿 토큰이 생성 편향을 유발하는지 검사하는 진단 도구로 활용
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Attention Sink
- — 모델의 어텐션 행렬에서 소수의 토큰이 전체 어텐션 질량의 대부분을 흡수하는 현상으로, 본 논문에서는 챗 템플릿의 특정 구분자 토큰들이 이미지 쿼리의 주된 키 수신 위치로 작동해 생성 과정의 계산적 중심이 됨을 의미한다.
- Semantic Register
- — 입력 프롬프트의 의미를 직접 인코딩한 토큰과는 별개로 생성 과정 내부에서 객체 정체성을 유지하거나 전달하는 텍스트측 토큰 슬롯을 가리키는 개념으로, 본문에서는 챗 템플릿 토큰이 이러한 역할을 암묵적으로 수행함이 관찰되었다.
- I2T Attention
- — joint attention 행렬을 텍스트·이미지 쿼리/키로 분할했을 때 이미지 쿼리들이 텍스트 키로 향하는 블록을 의미하며, 본 논문은 이 블록의 질량 분포를 통해 템플릿 토큰의 영향력을 측정했다.
- Chat Template Tokens
- — 사용자 프롬프트를 감싸는 시스템·유저·어시스턴트·구분자 등 포맷용 토큰들의 연속으로, 본문에서는 이 후행 구조적 스팬이 인코더 출력에서는 저(低) 의미성을 보이지만 디퓨전 트랜스포머 내부에서는 의미 유지에 핵심적임이 관찰되었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
