TL;DR
멀티모달 LLM은 시각적 근거가 필요한 비전 중심 과제에서 언어적 편향으로 인해 오류를 범하는 경우가 많다. 본 논문은 언어 모델 내부의 개별 attention head를 외부 비전 인코더의 위상적 이웃 구조에 맞춰 정렬함으로써 시각 이해 능력을 향상시켰다. 이 접근은 언어 모델의 주요 언어 능력을 해치지 않으면서 시각적 환각을 줄이고 Vision-Centric 벤치마크에서 평균 +3.6점의 향상을 달성했다.
왜 중요한가
멀티모달 LLM은 시각적 근거가 필요한 비전 중심 과제에서 언어적 편향으로 인해 오류를 범하는 경우가 많다. 본 논문은 언어 모델 내부의 개별 attention head를 외부 비전 인코더의 위상적 이웃 구조에 맞춰 정렬함으로써 시각 이해 능력을 향상시켰다. 이 접근은 언어 모델의 주요 언어 능력을 해치지 않으면서 시각적 환각을 줄이고 Vision-Centric 벤치마크에서 평균 +3.6점의 향상을 달성했다.
핵심 기여
헤드 단위 정렬(HeRA) 제안
HeRA는 Transformer의 개별 attention head 수준에서 외부 비전 인코더와의 국소 이웃 위상 구조를 맞추는 정렬 손실을 도입했다. 각 헤드의 출력 기여를 분리해 출력 프로젝션 블록에 투사한 표현을 대상으로 InfoNCE 기반의 대조 손실을 적용했다. 이 방법은 레이어 단위의 강제적 피처 매칭과 달리 이미 잘 정렬된 구성요소를 보존하면서 덜 정렬된 부분을 보강하는 효과를 보였다.
MKNN을 미분 가능한 대조 목표로 근사
원래의 MKNN 지표는 이산적 인덱스에 의존해 학습 중 직접 최적화가 불가능하다. 논문은 MKNN이 측정하는 국소 이웃 동등성을 유도하기 위해 다중 타깃 InfoNCE 손실을 사용해 연속적이고 미분 가능한 대체 목표를 정의했다. 이 손실은 배치 내에서 teacher vision encoder에서 계산된 k-최근접 이웃들을 양성으로 취급하고 나머지를 음성으로 분리해 정렬을 유도했다.
헤드 선택 기준으로 사전 MKNN 랭킹 사용
수백 개에 이르는 헤드 가운데 어느 헤드에 정렬을 적용할지 결정하기 위해 사전 학습된 LLM의 텍스트 표현으로 각 헤드의 MKNN 점수를 계산했다. 그 결과 최상위(heads with highest MKNN)와 최하위(heads with lowest MKNN)가 레이어 단위보다 더 큰 분산을 보였고, 최하위 헤드를 정렬 대상으로 택하는 전략이 실험적으로 가장 높은 성능 향상을 가져왔다. 이 선집 방법은 학습 전 계산으로 오버헤드를 줄이되 모델 구조에 적응적인 개입을 가능하게 했다.
폭넓은 실험으로 일관된 성능 향상 검증
LLaVA 파이프라인을 따르는 다양한 LLM 백본(Qwen, Vicuna, LLama3 등, 3B~14B)에서 18개 벤치마크를 포함해 평가를 수행했다. 전반적으로 Vision-Centric 항목에서 평균 +3.6점, 개별 모델별로 최대 +3.6점 이상의 향상이 관찰되었고 General/Knowledge/OCR 카테고리에서는 성능 저하 없이 보존되거나 개선되는 경향이 확인됐다. 또한 CHAIR-MSCOCO, AMBER, HallusionBench 같은 환각 테스트에서도 대부분의 모델에서 환각 지표가 개선되었다.
코드 공개로 재현성 확보
연구진은 HeRA 구현을 GitHub에 공개해 실험 재현과 추가 연구를 지원했다. 공개 저장소는 HeRA 손실 적용, MKNN 기반 헤드 랭킹 계산, LLaVA 파이프라인 통합 예시를 포함한다. 공개 코드는 실무자들이 제안된 기법을 자기 환경에 적용해 성능과 환각 민감도를 직접 검증할 수 있게 했다.
핵심 아이디어 이해하기
멀티모달 LLM은 텍스트 중심으로 사전학습되어 언어적 프라이어를 강하게 보유하고 있는 경우가 많다. 이러한 내부 조직은 레이어 단위의 고정된 표현 정렬이 언어 모델의 기존 기능과 충돌할 위험을 낳는다. 따라서 보다 미세한 수준인 attention head 단위에서 정렬을 제어하면 충돌을 줄이며 시각-언어 간 위상적 일관성을 보강할 수 있다.
방법론
HeRA는 표준 언어모델링 손실과 헤드 단위 대조 손실을 합한 복합 목적함수를 사용해 모델을 학습시킨다. 대조 손실은 각 배치에서 teacher vision encoder의 CLS 기반 임베딩으로부터 계산된 k-최근접 이웃들을 양성 표본으로 삼아 다중 타깃 InfoNCE 형태로 정의된다. 이렇게 하면 MKNN이 측정하는 로컬 이웃 일치를 미분 가능한 형태로 근사해 경사하강법으로 최적화가 가능해진다.
관련 Figure

다이어그램은 입력 이미지와 텍스트가 LLM에 결합된 뒤 각 attention head에서 추출된 표현이 출력 프로젝션 블록을 통해 d_G 차원으로 투사되는 과정을 시각화하고 있다. 이어서 teacher vision encoder에서 계산한 Top-k 이웃을 기준으로 다중 타깃 InfoNCE 손실을 적용해 해당 헤드 표현이 시각 표현의 국소 이웃 구조를 따르도록 학습함을 보여준다. 이 그림은 방법론의 핵심 구성요소인 헤드 추출, 투사, MKNN 기반 이웃 선택, 대조 손실 적용의 흐름을 연결해 논문의 작동 원리를 직관적으로 보강한다.
HeRA의 전체 파이프라인 다이어그램으로 언어모델의 헤드 수준 표현을 teacher vision encoder의 Top-k 이웃과 대조 학습으로 정렬하는 과정을 나타낸다.
주요 결과
HeRA를 다양한 LLM 백본에 적용한 결과 Vision-Centric 벤치마크에서 평균 +3.6점의 향상이 확인되었다. Table 2와 Table 4에서 Qwen3-8B, Qwen2.5-14B 등 여러 모델이 시각 중심 항목에서 유의미한 상승을 보였고 대부분의 모델에서 General/Knowledge/OCR 점수는 유지되거나 소폭 개선되었다. 환각 관련 평가(CHAIR, AMBER, HallusionBench)에서도 대체로 CHAIR s·i 감소와 AMBER의 정확도 및 F1 향상 등으로 더 신뢰성 있는 시각적 응답을 생성하는 경향이 관찰되었다.
관련 Figure

좌측 플롯은 각 레이어와 헤드에 대해 MKNN 점수의 분산을 제시해 헤드 단위가 레이어 단위보다 더 큰 분산을 보인다는 점을 시각적으로 확인시킨다. 우측 막대 그래프는 최하위(worst-5)와 최상위(top-5) 헤드의 MKNN 점수가 HeRA 적용 전후로 어떻게 변하는지를 보여주며, 최하위 헤드에서의 점수 증가가 가장 뚜렷해 최하위 헤드 정렬 전략의 우수성을 뒷받침한다. 이 차트는 헤드 선택 전략과 HeRA 적용의 직접적인 상관관계를 수치적으로 보강하는 근거 자료로 작용한다.
헤드별 MKNN 점수 분포와 최상위/최하위 헤드의 MKNN 변화량을 비교한 차트로, 최하위 헤드 정렬의 유효성을 보여준다.
기술 상세
아키텍처 측면에서 MLLM은 사전학습된 LLM과 고정된 비전 인코더, 그리고 이 둘을 잇는 projector로 구성된다. HeRA는 언어 모델의 각 multi-head self-attention에서 h번째 head 출력 h_{l,h}을 출력 프로젝션의 블록 W_{O,h}로 투사해 d_G 차원 표현 M^{l,h}=h_{l,h}W_{O,h}을 얻는다. 이 투사된 head 수준 표현에 대해 배치 기반의 InfoNCE 대조 손실을 적용해 teacher vision encoder의 Top-k 이웃과의 유사도를 높이고 나머지 배치 샘플과 분리하도록 학습한다.
한계점
헤드 수를 지나치게 늘려 정렬을 적용하면 언어 모델의 핵심 언어 능력과 충돌하여 성능이 저하되는 현상이 관찰되었다. 논문에서 중앙값 이상의 헤드 여러 개를 동시 정렬할 경우 성능 저하가 발생했고, 실험에서는 m=5개의 최하위 정렬 헤드를 추천해 최적 성능을 얻었다. 또한 teacher vision encoder의 종류에 민감해 DINO 계열 teacher에서 일관된 이득이 관찰된 반면 SigLIP2 자체를 teacher로 사용할 때 효과가 제한적이었다.
실무 활용
HeRA는 기존 LLaVA 스타일 멀티모달 훈련 파이프라인에 비교적 낮은 비용으로 통합할 수 있는 헤드 수준 정렬 규제이다. GitHub 저장소를 통해 구현과 실험 코드를 제공해 실무 환경에서 재현이 가능하다. 특히 비전 이해를 강화하고 환각을 완화하려는 애플리케이션에서 유용하게 적용될 수 있다.
- 시각적 근거가 중요한 VQA(Visual Question Answering) 서비스의 응답 신뢰도 향상
- 로봇·자동화 시스템에서 카메라 입력을 기반으로 한 정확한 물체 인식·개수 판정 보조
- 멀티모달 검색·정렬 파이프라인에서 시각-텍스트 표현의 지역적 일관성 개선
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Platonic Representation Hypothesis
- — 서로 다른 모달리티의 표현 공간이 국소적으로 동일한 이웃 구조를 보유한다는 가설이다. 이 가설은 의미적으로 유사한 입력이 각기 다른 잠재공간에서 유사한 근접 이웃을 갖는다고 가정하며, 서로 다른 모달 간 위상적 일관성을 정량화하는 근거를 제공한다. 본문에서는 이 가설을 근거로 지역적 이웃 구조를 보존하는 정렬이 멀티모달 성능 향상으로 이어질 수 있음을 실험적으로 검증했다.
- Mutual K-Nearest Neighbor
- — 두 표현 함수가 동일한 데이터 포인트에 대해 생성하는 국소 이웃 집합의 일치를 측정하는 메트릭이다. 각 샘플에 대해 k-최근접 이웃을 구한 뒤 언어 표현과 시각 표현의 교집합 비율을 평균해 0~1 범위의 정렬 점수를 얻는다. 본문에서는 MKNN을 헤드 수준 진단 지표로 활용해 정렬 우선순위를 결정하고 이를 학습 목표의 근사로 삼았다.
- Head-wise Representation Alignment
- — Transformer의 개별 attention head 출력에 대응하는 표현을 대상으로 외부 비전 인코더와의 국소적 이웃 구조를 맞추는 정렬 기법이다. 각 헤드에서 추출한 표현을 출력 프로젝션 블록으로 투사한 뒤 contrastive objective를 적용해 해당 헤드의 이웃 구조가 비전 쪽과 일치하도록 유도한다. 본문에서는 이 접근이 고정 레이어 정렬보다 언어모델의 언어 성능을 덜 해치면서 비전 성능을 향상시킴이 확인됐다.
- InfoNCE
- — 타깃 이웃과의 유사도를 양성 샘플로, 배치 내 다른 샘플들을 음성으로 취급하여 소프트맥스 비율의 음의 로그를 최소화하는 대조 학습 손실이다. 본문에서는 다중 타깃 변형을 사용해 각 샘플이 teacher vision encoder에서 계산한 k-최근접 이웃들과 유사해지도록 학습시켰다. τ 하이퍼파라미터가 확률 분포의 샤프니스(온도)를 조절하며 이 값은 학습 중 최적화 대상이 되기도 했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.