본문으로 건너뛰기
HF Daily Papers조회 1

헤드에 주목하라: 다중모달 대형 언어 모델을 위한 위상적 표현 정렬

멀티모달 LLM은 시각적 근거가 필요한 비전 중심 과제에서 언어적 편향으로 인해 오류를 범하는 경우가 많다. 본 논문은 언어 모델 내부의 개별 attention head를 외부 비전 인코더의 위상적 이웃 구조에 맞춰 정렬함으로써 시각 이해 능력을 향상시켰다. 이 접근은 언어 모델의 주요 언어 능력을 해치지 않으면서 시각적 환각을 줄이고 Vision-Centric 벤치마크에서 평균 +3.6점의 향상을 달성했다.

용어 해설

플라토닉 표현 가설(Platonic Representation Hypothesis)
서로 다른 모달리티의 표현 공간이 국소적으로 동일한 이웃 구조를 보유한다는 가설이다. 이 가설은 의미적으로 유사한 입력이 각기 다른 잠재공간에서 유사한 근접 이웃을 갖는다고 가정하며, 서로 다른 모달 간 위상적 일관성을 정량화하는 근거를 제공한다. 본문에서는 이 가설을 근거로 지역적 이웃 구조를 보존하는 정렬이 멀티모달 성능 향상으로 이어질 수 있음을 실험적으로 검증했다.
상호 K-최근접 이웃(MKNN)(Mutual K-Nearest Neighbor)
두 표현 함수가 동일한 데이터 포인트에 대해 생성하는 국소 이웃 집합의 일치를 측정하는 메트릭이다. 각 샘플에 대해 k-최근접 이웃을 구한 뒤 언어 표현과 시각 표현의 교집합 비율을 평균해 0~1 범위의 정렬 점수를 얻는다. 본문에서는 MKNN을 헤드 수준 진단 지표로 활용해 정렬 우선순위를 결정하고 이를 학습 목표의 근사로 삼았다.
헤드 단위 표현 정렬(Head-wise Representation Alignment)
Transformer의 개별 attention head 출력에 대응하는 표현을 대상으로 외부 비전 인코더와의 국소적 이웃 구조를 맞추는 정렬 기법이다. 각 헤드에서 추출한 표현을 출력 프로젝션 블록으로 투사한 뒤 contrastive objective를 적용해 해당 헤드의 이웃 구조가 비전 쪽과 일치하도록 유도한다. 본문에서는 이 접근이 고정 레이어 정렬보다 언어모델의 언어 성능을 덜 해치면서 비전 성능을 향상시킴이 확인됐다.
InfoNCE 대조 손실(InfoNCE)
타깃 이웃과의 유사도를 양성 샘플로, 배치 내 다른 샘플들을 음성으로 취급하여 소프트맥스 비율의 음의 로그를 최소화하는 대조 학습 손실이다. 본문에서는 다중 타깃 변형을 사용해 각 샘플이 teacher vision encoder에서 계산한 k-최근접 이웃들과 유사해지도록 학습시켰다. τ 하이퍼파라미터가 확률 분포의 샤프니스(온도)를 조절하며 이 값은 학습 중 최적화 대상이 되기도 했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 22.수집 2026. 07. 01.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.