본문으로 건너뛰기

좁은 시야에서 파노라마 시야로: 어텐션 가이드 콜드스타트를 통한 멀티모달 추론의 재구성

멀티모달 추론 모델이 시각 정보를 충분히 활용하지 못하는 '게으른 어텐션' 현상을 발견하고 이를 정량화하는 지표인 VAS를 제안했다. 텍스트 위주의 초기 학습이 오히려 시각 정보 활용 능력을 높인다는 역설적 발견을 바탕으로, 모델이 이미지에 더 집중하게 만드는 새로운 학습 프레임워크를 통해 성능을 크게 개선했다.

용어 해설

콜드스타트 초기화(Cold-start Initialization)
모델 학습의 초기 단계에서 사전 학습된 가중치를 특정 작업에 맞게 조정하기 위해 수행하는 초기 미세 조정 과정이다. 이 단계에서 형성된 어텐션 패턴이 이후 강화학습 성능에 결정적인 영향을 미친다.
시각적 접지(Visual Grounding)
모델이 생성하는 텍스트 토큰이 이미지의 실제 시각적 요소와 정확히 연결되는 능력을 의미한다. 추론 과정에서 모델이 단순히 언어적 확률에 의존하는 것이 아니라, 이미지의 구체적인 특징을 근거로 판단하도록 만드는 핵심 기술이다.
게으른 어텐션 국소화(Lazy Attention Localization)
멀티모달 콜드스타트 학습 시 모델이 시각적 토큰에 대한 어텐션을 높이지 못하고 기존의 텍스트 중심 어텐션 분포를 그대로 유지하려는 현상이다. 이는 모델이 시각 정보를 추론의 핵심 근거로 활용하는 데 방해가 되는 병목 현상으로 작용한다.
그룹 상대 정책 최적화(GRPO)
Group Relative Policy Optimization의 약자로, 여러 개의 출력 샘플을 생성하여 그룹 내 상대적 성능을 비교함으로써 학습을 안정화하는 강화학습 알고리즘이다. 본 논문에서는 시각적 어텐션 비율을 보상으로 활용하여 이 알고리즘을 적용했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 04.수집 2026. 03. 11.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.