본문으로 건너뛰기
HF Daily Papers조회 3

지각 오류를 넘어서: 대형 시각 언어 모델의 의미적 고착 현상 연구

대형 시각 언어 모델(VLM)이 시각적 정보를 잘 인식함에도 불구하고, 왜 특정 상황에서 엉뚱한 답변을 내놓는지에 대한 근본적인 원인을 분석한다. 단순히 그림을 못 보는 것이 아니라, 익숙한 상식이나 규칙에 사로잡혀 새로운 지시사항을 무시하는 '의미적 고착' 현상을 규명하고 이를 해결할 실마리를 제공한다.

용어 해설

의미적 고착(Semantic Fixation)
인지 심리학의 고착(Fixation) 개념을 AI에 적용한 것으로, 프롬프트가 새로운 규칙이나 대안적 해석을 명시했음에도 불구하고 모델이 학습 시 습득한 기본적이고 익숙한 의미 해석을 고수하는 현상이다. 이는 모델의 유연한 추론 능력을 저해하는 주요 요인이 된다.
미제르 규칙(Misere Rules)
게임 이론에서 일반적인 승리 조건을 정반대로 뒤집어, 원래 승리해야 하는 상황을 패배로 간주하는 규칙이다. 본 논문에서는 VLMs가 동일한 시각적 상태에서 승패의 의미만 바뀌었을 때 이를 올바르게 재매핑할 수 있는지 평가하는 도구로 사용된다.
활성화 스티어링(Activation Steering)
모델을 재학습시키지 않고 추론 과정에서 특정 레이어의 활성화 값(Activation)을 미세하게 조정하여 모델의 출력 방향을 유도하는 기법이다. 본 연구에서는 이를 통해 모델 내부의 의미 표현을 수정하여 고착된 오류를 해결할 수 있는지 확인한다.
사고의 사슬(Chain-of-Thought)
모델이 최종 답변을 내기 전에 단계적인 추론 과정을 거치도록 유도하는 프롬프팅 기법이다. 복잡한 논리 구조를 가진 문제에서 성능을 높이는 데 기여하며, 본 논문에서는 규칙 재매핑 상황에서도 효과가 있는지 검증하는 데 쓰인다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 13.수집 2026. 04. 16.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.