본문으로 건너뛰기

시각화가 추론의 첫 단계일 때: 시각적 사고의 사슬(Visual CoT)을 위한 벤치마크 MIRA

복잡한 시각 추론에서 텍스트 CoT의 한계를 입증하고 시각적 중간 단계(Visual CoT)의 필요성을 제시하는 MIRA 벤치마크 연구를 소개한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

기존 멀티모달 모델들이 텍스트 기반 사고의 사슬(CoT)만으로는 해결하기 어려운 복잡한 시각·수리 추론 문제를 평가하기 위해 MIRA 벤치마크가 제안됐다. MIRA는 중간 과정에서 시각적 보조 자료를 활용해야만 풀 수 있는 문제들로 구성되어 있으며, 현재 주요 MLLM들은 직접 입력 시 20% 미만의 낮은 정확도를 기록했다. 실험 결과 텍스트 CoT는 성능 향상에 거의 기여하지 못했으나, 사람이 작성한 시각적 단서를 제공했을 때 정확도가 평균 33.7%p 상승하는 결과가 나타났다. 이는 현재 모델들이 시각적 중간 표상을 스스로 생성하고 활용하는 능력이 부족함을 시사하며, 향후 시각적 사고 능력 강화가 모델 발전의 핵심 과제임을 보여준다.

챕터별 상세

00:00

연구 배경 및 기존 MLLM의 한계

최신 멀티모달 모델들이 MMMU나 MMStar 같은 기존 벤치마크에서는 우수한 성적을 거두고 있으나 실제 복잡한 시각적 추론 능력에는 의문이 제기됐다. 텍스트 기반의 사고의 사슬(CoT) 기법이 언어적 추론에는 효과적이지만 시각적 정보가 핵심인 문제에서는 충분한 성능을 내지 못하는 현상이 발견됐다. 모델이 이미지 정보를 텍스트로 변환하는 과정에서 정보 손실이 발생하며 이는 최종적인 추론 실패로 이어진다. 따라서 시각적 정보를 중간 단계에서 직접 활용하는 'Visual CoT'의 필요성이 대두됐다.

Chain-of-Thought(CoT)는 모델이 단계별로 생각하도록 유도하여 복잡한 문제 해결력을 높이는 기법이다.

05:00

MIRA 벤치마크의 설계 원칙

MIRA는 모델이 문제를 풀기 위해 반드시 중간 단계의 시각적 보조(Visual Hint)를 생성하거나 활용해야 하도록 설계된 벤치마크이다. 기하학, 공간 인지, 논리 퍼즐 등 시각적 요소가 필수적인 7개 도메인의 문제들로 구성됐다. 단순히 이미지를 보고 답하는 것을 넘어 문제를 해결하기 위한 '시각적 사고 과정'이 개입되어야 정답 도출이 가능하다. 이는 기존 벤치마크들이 텍스트 추론만으로도 어느 정도 해결 가능했던 점과 차별화되는 지점이다.

벤치마크는 AI 모델의 특정 능력을 측정하기 위해 표준화된 시험지 역할을 한다.

10:00

주요 모델의 성능 평가 결과

GPT-4o를 포함한 최신 MLLM들을 대상으로 MIRA 벤치마크를 테스트한 결과 직접 입력 시 정확도가 20% 미만에 머물렀다. 텍스트 CoT를 적용했을 때 성능 향상이 거의 없거나 일부 사례에서는 오히려 정확도가 하락하는 결과가 나타났다. 이는 텍스트만으로는 시각적 추론의 복잡성을 담아내지 못한다는 것을 의미한다. 반면 사람이 작성한 시각적 중간 단서를 입력으로 주었을 때는 모델의 성능이 비약적으로 상승했다.

정확도 하락 현상은 모델이 잘못된 텍스트 추론 과정을 생성하여 정답에서 멀어지는 'Hallucination'과 관련이 있다.

15:00

시각적 단서 제공에 따른 성능 변화

사람이 만든 시각적 가이드를 제공했을 때 모델의 정확도는 평균 33.7%p 상승하며 시각적 중간 표상의 중요성을 입증했다. 특히 복잡한 기하학 문제에서 시각적 보조선이나 중간 단계의 그림이 주어졌을 때 모델의 논리적 오류가 크게 줄어들었다. 이는 현재 MLLM의 병목 현상이 추론 엔진 자체보다 시각적 정보를 추론에 적합한 형태로 스스로 재구성하는 능력에 있음을 보여준다. 연구팀은 향후 모델이 스스로 이러한 시각적 CoT를 생성하도록 학습시키는 방향을 제시했다.

시각적 중간 표상은 추론 과정에서 참조할 수 있는 도표, 보조선, 강조된 이미지 영역 등을 의미한다.

용어 해설

시각적 사고의 사슬(Visual Chain-of-Thought)
복잡한 추론 문제를 해결할 때 텍스트뿐만 아니라 중간 단계의 시각적 보조 자료(그림, 도표 등)를 생성하거나 활용하여 단계적으로 사고하는 기법이다. 단순한 텍스트 추론만으로 해결하기 어려운 기하학적 문제나 복잡한 공간 인지 작업에서 모델의 논리적 정확도를 높이는 핵심적인 역할을 한다.
멀티모달 대형 언어 모델(MLLM)
텍스트, 이미지, 오디오 등 다양한 형태의 데이터를 동시에 이해하고 처리할 수 있는 거대 언어 모델이다. 시각적 입력을 받아 텍스트로 답하거나 이미지의 맥락을 파악하여 복잡한 지시를 수행하는 능력을 갖추고 있어 시각적 추론의 핵심 도구로 사용된다.
텍스트 사고의 사슬(Textual Chain-of-Thought)
모델이 최종 답안을 내놓기 전에 중간 추론 과정을 텍스트로 나열하도록 유도하는 프롬프팅 기법이다. 논리적 단계를 명시함으로써 복잡한 문제 해결 능력을 높이지만, 시각적 정보가 필수적인 문제에서는 텍스트만으로 상황을 묘사하는 데 한계가 존재한다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 30.수집 2026. 07. 07.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.