추가 이미지 분석

좌우 패널은 각각 CMA와 MAS로 점수화한 상위 k 집합의 IoU를 k에 대해 플롯해 작은 k에서 두 방법이 서로 다른 교차모달 겹침 특성을 보인다는 점을 보여준다. 그림에서 k=4와 k=20 지점의 IoU 값을 주석으로 표시해 CMA가 상대적으로 작은 k에서 교차모달 겹침을 더 잘 포착하는 경향을 확인할 수 있다.
상위 k 헤드 수에 따른 IoU 변화를 시각화한 그래프로 CMA와 MAS의 차이를 비교하고 있다.

플롯은 작은 k에서 MAS가 강한 음의 상관을 보이는 반면 CMA는 더 빠르게 양의 상관으로 회복되는 양상을 나타내어 CMA가 교차모달 헤드 순위에서 더 일관된 신호를 제공함을 시사한다. 이 결과는 헤드 선택에서 인과적 보상이 실무적 유용성을 높이는 근거로 연결된다.
상위 k에 따른 Spearman 상관계수를 플롯해 CMA와 MAS에서 계층적 순위 상관성이 어떻게 변하는지 보이고 있다.
용어 해설
- 인과 매개 효과 분석(Causal Mediation Analysis)
- — 모델 입력을 '정상 입력'과 '증강 또는 손상된 입력'으로 나누어 두 경우의 내부 활성화 차이를 계산해 특정 구성요소가 출력에 미치는 인과적 기여도를 추정하는 기법이다. 본 논문에서는 주어진 증거를 대체한 입력과 원본 입력의 attention 차이를 평균하여 각 attention head의 인과적 영향력을 산출하는 데 사용되었다. 인과적 근거를 찾을 때 상관관계 기반 점수보다 더 강한 증거를 제공하므로 헤드 선택의 신뢰도를 높인다.
- 프리필 패스(Prefill Pass)
- — 모델이 실제 토큰 디코딩을 시작하기 전에 입력 시퀀스를 한 번 전방 전달하여 내부 attention과 활성화를 생성하는 단계이다. 본 방법은 이 단계에서 얻는 attention 맵을 직접 집계해 추가 생성 호출 없이 근거 위치를 도출한다. 프리필 패스 이용은 반복적 생성 오버헤드와 KV 캐시 성장을 회피해 추론 비용을 크게 줄이는 핵심 설계이다.
- 검색/복사 헤드(Retrieval Head)
- — 문서 내에서 근거 토큰이나 패치로 강하게 주의를 집중해 복사형 정보 흐름을 매개하는 주목(attention) 헤드를 말한다. 본 연구에서는 이러한 헤드를 식별해 헤드별 attention을 평균하면 텍스트 구간과 이미지 슬롯 양쪽에서 근거 점수를 얻을 수 있었다. 검색 헤드는 모델 내부에서 희소하게 나타나며 소수의 헤드로도 상당한 근거 신호를 캡처할 수 있다.
- 슬라이딩 윈도우 점수화(Sliding Window Scoring)
- — 텍스트를 고정 길이 또는 중간 길이의 연속 토큰 창으로 분할해 각 창에 대해 평균 attention을 계산하는 절차이다. 본 논문에서는 probe 집합의 중앙값 창 길이를 W로 정하고 선택된 헤드의 평균 attention으로 각 창을 점수화해 텍스트 근거를 지역화했다. 창 단위 집계는 긴 문서에서 토큰 단위 잡음을 줄이고 근거 범위를 더 안정적으로 결정하는 데 기여했다.
- 최소-최대 정규화(Min-Max Normalization)
- — 서로 다른 스케일을 가진 이미지 점수와 텍스트 점수를 동일 선상에 놓기 위해 최저값을 0으로 최고값을 1로 선형 변환하는 표준화 기법이다. 본 방법은 이미지 슬롯과 텍스트 윈도우 점수를 동일 임계값으로 비교 가능하게 만들며 이후 F1 최적화된 임계값을 적용하는 데 전처리로 사용되었다. 정규화가 없으면 한 쪽 modality가 과도하게 우세해 잘못된 귀속이 발생할 위험이 커진다.
코드 예제
1: g_phi (language model), x (input prompt), Q (query position), H (selected heads), W (span length)
2: A <- g_phi(x, Q, H)
3: a_bar <- mean_{(l,h),q} A_{l,h,q}
4: for each image slot s do
5: v_s_img <- a_bar_s
6: end for
7: for each sliding window w over text do
8: v_w_txt <- a_bar_w
9: end for
10: [v_img, v_txt] <- MinMaxNorm([v_img, v_txt])
11: I_hat <- { s : v_s_img >= T_img } ; T_hat <- { w : v_w_txt >= T_txt }
12: if I_hat union T_hat == empty then
13: (m_star, e_star) <- argmax_{m,e} v_e^m
14: I_hat <- { e_star : m_star == img } ; T_hat <- { e_star : m_star == txt }
15: end if
16: return I_hat, T_hat이 의사코드는 선택된 attention 헤드의 평균 어텐션을 이미지 슬롯과 텍스트 슬라이딩 윈도우로 집계해 min-max 정규화 후 임계값으로 필터링하여 근거 이미지와 텍스트 창을 반환하는 MultAttnAttrib의 핵심 연산 흐름을 나타내는 의사코드이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


