본문으로 건너뛰기
HF Daily Papers조회 1

MultAttnAttrib: 장문 멀티모달 질문응답에서 학습 불필요한 근거 귀속 방법

MultAttnAttrib는 모델의 프리필 어텐션에서 소수의 교차모달 검색 헤드를 선택해 추가 학습 없이 텍스트와 이미지 근거를 단일 전방 전달로 지역화해 기준 프롬프팅보다 F1과 추론 지연에서 우수했다.

추가 이미지 분석

상위 k 헤드 수에 따른 IoU 변화를 시각화한 그래프로 CMA와 MAS의 차이를 비교하고 있다.
Chart

좌우 패널은 각각 CMA와 MAS로 점수화한 상위 k 집합의 IoU를 k에 대해 플롯해 작은 k에서 두 방법이 서로 다른 교차모달 겹침 특성을 보인다는 점을 보여준다. 그림에서 k=4와 k=20 지점의 IoU 값을 주석으로 표시해 CMA가 상대적으로 작은 k에서 교차모달 겹침을 더 잘 포착하는 경향을 확인할 수 있다.

상위 k 헤드 수에 따른 IoU 변화를 시각화한 그래프로 CMA와 MAS의 차이를 비교하고 있다.

상위 k에 따른 Spearman 상관계수를 플롯해 CMA와 MAS에서 계층적 순위 상관성이 어떻게 변하는지 보이고 있다.
Chart

플롯은 작은 k에서 MAS가 강한 음의 상관을 보이는 반면 CMA는 더 빠르게 양의 상관으로 회복되는 양상을 나타내어 CMA가 교차모달 헤드 순위에서 더 일관된 신호를 제공함을 시사한다. 이 결과는 헤드 선택에서 인과적 보상이 실무적 유용성을 높이는 근거로 연결된다.

상위 k에 따른 Spearman 상관계수를 플롯해 CMA와 MAS에서 계층적 순위 상관성이 어떻게 변하는지 보이고 있다.

용어 해설

인과 매개 효과 분석(Causal Mediation Analysis)
모델 입력을 '정상 입력'과 '증강 또는 손상된 입력'으로 나누어 두 경우의 내부 활성화 차이를 계산해 특정 구성요소가 출력에 미치는 인과적 기여도를 추정하는 기법이다. 본 논문에서는 주어진 증거를 대체한 입력과 원본 입력의 attention 차이를 평균하여 각 attention head의 인과적 영향력을 산출하는 데 사용되었다. 인과적 근거를 찾을 때 상관관계 기반 점수보다 더 강한 증거를 제공하므로 헤드 선택의 신뢰도를 높인다.
프리필 패스(Prefill Pass)
모델이 실제 토큰 디코딩을 시작하기 전에 입력 시퀀스를 한 번 전방 전달하여 내부 attention과 활성화를 생성하는 단계이다. 본 방법은 이 단계에서 얻는 attention 맵을 직접 집계해 추가 생성 호출 없이 근거 위치를 도출한다. 프리필 패스 이용은 반복적 생성 오버헤드와 KV 캐시 성장을 회피해 추론 비용을 크게 줄이는 핵심 설계이다.
검색/복사 헤드(Retrieval Head)
문서 내에서 근거 토큰이나 패치로 강하게 주의를 집중해 복사형 정보 흐름을 매개하는 주목(attention) 헤드를 말한다. 본 연구에서는 이러한 헤드를 식별해 헤드별 attention을 평균하면 텍스트 구간과 이미지 슬롯 양쪽에서 근거 점수를 얻을 수 있었다. 검색 헤드는 모델 내부에서 희소하게 나타나며 소수의 헤드로도 상당한 근거 신호를 캡처할 수 있다.
슬라이딩 윈도우 점수화(Sliding Window Scoring)
텍스트를 고정 길이 또는 중간 길이의 연속 토큰 창으로 분할해 각 창에 대해 평균 attention을 계산하는 절차이다. 본 논문에서는 probe 집합의 중앙값 창 길이를 W로 정하고 선택된 헤드의 평균 attention으로 각 창을 점수화해 텍스트 근거를 지역화했다. 창 단위 집계는 긴 문서에서 토큰 단위 잡음을 줄이고 근거 범위를 더 안정적으로 결정하는 데 기여했다.
최소-최대 정규화(Min-Max Normalization)
서로 다른 스케일을 가진 이미지 점수와 텍스트 점수를 동일 선상에 놓기 위해 최저값을 0으로 최고값을 1로 선형 변환하는 표준화 기법이다. 본 방법은 이미지 슬롯과 텍스트 윈도우 점수를 동일 임계값으로 비교 가능하게 만들며 이후 F1 최적화된 임계값을 적용하는 데 전처리로 사용되었다. 정규화가 없으면 한 쪽 modality가 과도하게 우세해 잘못된 귀속이 발생할 위험이 커진다.

코드 예제

text
1: g_phi (language model), x (input prompt), Q (query position), H (selected heads), W (span length)
2: A <- g_phi(x, Q, H)
3: a_bar <- mean_{(l,h),q} A_{l,h,q}
4: for each image slot s do
5:   v_s_img <- a_bar_s
6: end for
7: for each sliding window w over text do
8:   v_w_txt <- a_bar_w
9: end for
10: [v_img, v_txt] <- MinMaxNorm([v_img, v_txt])
11: I_hat <- { s : v_s_img >= T_img } ; T_hat <- { w : v_w_txt >= T_txt }
12: if I_hat union T_hat == empty then
13:   (m_star, e_star) <- argmax_{m,e} v_e^m
14:   I_hat <- { e_star : m_star == img } ; T_hat <- { e_star : m_star == txt }
15: end if
16: return I_hat, T_hat

이 의사코드는 선택된 attention 헤드의 평균 어텐션을 이미지 슬롯과 텍스트 슬라이딩 윈도우로 집계해 min-max 정규화 후 임계값으로 필터링하여 근거 이미지와 텍스트 창을 반환하는 MultAttnAttrib의 핵심 연산 흐름을 나타내는 의사코드이다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 01.수집 2026. 07. 07.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.