용어 해설
- 교차 모달 어텐션(Cross-Modal Attention)
- — 서로 다른 모달리티의 토큰 시퀀스가 상대 모달리티의 정보를 선택적으로 참조하는 Attention이다. 이 논문에서는 Text·Audio·Video 사이의 정보를 연결해 생성 과정에서 의미와 시간·공간 정보를 교환하지만, 의도하지 않은 대상까지 의미가 퍼지는 Semantic Leakage의 통로가 되기도 한다.
- 의미 누출(Semantic Leakage)
- — 프롬프트가 특정 개체에 지정한 속성이나 소리가 다른 개체로 잘못 전달되는 현상이다. 예를 들어 앵무새가 말해야 하는 장면에서 Audio-Video 상호작용이 음성 의미를 사람 형태의 해적에게 보내 해적이 말하거나 앵무새 같은 외형을 갖게 만든다.
- 발화원 귀속(Source Attribution)
- — 생성된 소리나 행동을 장면 속 올바른 시각적 개체에 연결하는 문제다. Audio 토큰과 Video 패치 사이의 Attention이 프롬프트의 지정 대상 대신 학습된 시각적 선호를 따르면, 실제 소리의 발화원이 다른 개체로 바뀐다.
- 추론 시 개입(Inference-Time Intervention)
- — 모델을 재학습하거나 추가 손실 함수를 도입하지 않고 생성 중 내부 연산을 조정하는 방법이다. 이 논문은 Denoising 단계마다 Cross-Attention Logit에 Bias를 더해 의도된 연결은 강화하고 충돌하는 연결은 억제한다.
- Diffusion Transformer(Diffusion Transformer (DiT))
- — Diffusion 모델의 Denoising 과정을 Transformer 구조로 처리하는 생성 백본이다. 논문 속 Audio-Video 모델은 Text 조건과 Audio·Video 표현을 Cross-Attention으로 결합하며, 이 결합 구조가 세 모달리티 사이의 의미 라우팅과 누출에 영향을 준다.
- 교차 어텐션(Cross-Attention)
- — 한 모달리티의 Query가 다른 모달리티의 Key와 Value를 참조해 조건 정보를 출력에 반영하는 연산이다. 논문은 Text→Audio, Text→Video, Audio↔Video의 세 연결을 분리해 분석하고, 각 연결의 Pre-Softmax Logit을 조정한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




