TL;DR
기존 멀티모달 모델들이 텍스트 기반 사고의 사슬(CoT)만으로는 해결하기 어려운 복잡한 시각·수리 추론 문제를 평가하기 위해 MIRA 벤치마크가 제안됐다. MIRA는 중간 과정에서 시각적 보조 자료를 활용해야만 풀 수 있는 문제들로 구성되어 있으며, 현재 주요 MLLM들은 직접 입력 시 20% 미만의 낮은 정확도를 기록했다. 실험 결과 텍스트 CoT는 성능 향상에 거의 기여하지 못했으나, 사람이 작성한 시각적 단서를 제공했을 때 정확도가 평균 33.7%p 상승하는 결과가 나타났다. 이는 현재 모델들이 시각적 중간 표상을 스스로 생성하고 활용하는 능력이 부족함을 시사하며, 향후 시각적 사고 능력 강화가 모델 발전의 핵심 과제임을 보여준다.
챕터별 상세
연구 배경 및 기존 MLLM의 한계
Chain-of-Thought(CoT)는 모델이 단계별로 생각하도록 유도하여 복잡한 문제 해결력을 높이는 기법이다.
MIRA 벤치마크의 설계 원칙
벤치마크는 AI 모델의 특정 능력을 측정하기 위해 표준화된 시험지 역할을 한다.
주요 모델의 성능 평가 결과
정확도 하락 현상은 모델이 잘못된 텍스트 추론 과정을 생성하여 정답에서 멀어지는 'Hallucination'과 관련이 있다.
시각적 단서 제공에 따른 성능 변화
시각적 중간 표상은 추론 과정에서 참조할 수 있는 도표, 보조선, 강조된 이미지 영역 등을 의미한다.
용어 해설
- Visual Chain-of-Thought
- — 복잡한 추론 문제를 해결할 때 텍스트뿐만 아니라 중간 단계의 시각적 보조 자료(그림, 도표 등)를 생성하거나 활용하여 단계적으로 사고하는 기법이다. 단순한 텍스트 추론만으로 해결하기 어려운 기하학적 문제나 복잡한 공간 인지 작업에서 모델의 논리적 정확도를 높이는 핵심적인 역할을 한다.
- MLLM
- — 텍스트, 이미지, 오디오 등 다양한 형태의 데이터를 동시에 이해하고 처리할 수 있는 거대 언어 모델이다. 시각적 입력을 받아 텍스트로 답하거나 이미지의 맥락을 파악하여 복잡한 지시를 수행하는 능력을 갖추고 있어 시각적 추론의 핵심 도구로 사용된다.
- Textual Chain-of-Thought
- — 모델이 최종 답안을 내놓기 전에 중간 추론 과정을 텍스트로 나열하도록 유도하는 프롬프팅 기법이다. 논리적 단계를 명시함으로써 복잡한 문제 해결 능력을 높이지만, 시각적 정보가 필수적인 문제에서는 텍스트만으로 상황을 묘사하는 데 한계가 존재한다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
