본문으로 건너뛰기

Audio-Video 생성 모델의 Attention Triangle

세 모달리티의 Attention 경로를 함께 조정해 소리의 발화원과 시각적 속성 누출을 동시에 완화

용어 해설

교차 모달 어텐션(Cross-Modal Attention)
서로 다른 모달리티의 토큰 시퀀스가 상대 모달리티의 정보를 선택적으로 참조하는 Attention이다. 이 논문에서는 Text·Audio·Video 사이의 정보를 연결해 생성 과정에서 의미와 시간·공간 정보를 교환하지만, 의도하지 않은 대상까지 의미가 퍼지는 Semantic Leakage의 통로가 되기도 한다.
의미 누출(Semantic Leakage)
프롬프트가 특정 개체에 지정한 속성이나 소리가 다른 개체로 잘못 전달되는 현상이다. 예를 들어 앵무새가 말해야 하는 장면에서 Audio-Video 상호작용이 음성 의미를 사람 형태의 해적에게 보내 해적이 말하거나 앵무새 같은 외형을 갖게 만든다.
발화원 귀속(Source Attribution)
생성된 소리나 행동을 장면 속 올바른 시각적 개체에 연결하는 문제다. Audio 토큰과 Video 패치 사이의 Attention이 프롬프트의 지정 대상 대신 학습된 시각적 선호를 따르면, 실제 소리의 발화원이 다른 개체로 바뀐다.
추론 시 개입(Inference-Time Intervention)
모델을 재학습하거나 추가 손실 함수를 도입하지 않고 생성 중 내부 연산을 조정하는 방법이다. 이 논문은 Denoising 단계마다 Cross-Attention Logit에 Bias를 더해 의도된 연결은 강화하고 충돌하는 연결은 억제한다.
Diffusion Transformer(Diffusion Transformer (DiT))
Diffusion 모델의 Denoising 과정을 Transformer 구조로 처리하는 생성 백본이다. 논문 속 Audio-Video 모델은 Text 조건과 Audio·Video 표현을 Cross-Attention으로 결합하며, 이 결합 구조가 세 모달리티 사이의 의미 라우팅과 누출에 영향을 준다.
교차 어텐션(Cross-Attention)
한 모달리티의 Query가 다른 모달리티의 Key와 Value를 참조해 조건 정보를 출력에 반영하는 연산이다. 논문은 Text→Audio, Text→Video, Audio↔Video의 세 연결을 분리해 분석하고, 각 연결의 Pre-Softmax Logit을 조정한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 03.수집 2026. 09. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.