본문으로 건너뛰기
HF Daily Papers조회 1

가볍게 관찰하고 깊게 사고하라: 멀티모달 Chain-of-Thought(CoT) 추론의 가능성과 한계

Chain-of-Thought(CoT)는 복잡한 추론을 위해 널리 쓰이는 기법이나, 멀티모달 입력을 다룰 때 일관된 성능 향상을 보이지 않는다. 본문은 CoT가 수학·과학·다중 이미지 추론에서 유의미한 이득을 주는 반면 시각적 정합이나 객체 수세기 등 감지 중심 과제에서는 성능 저하를 초래하고, 이유로 시각적 반성(visual reflection)의 약화를 확인했다.

용어 해설

체인-오브-생각(CoT)(Chain-of-Thought (CoT))
CoT는 모델이 답안을 직접 생성하는 대신 단계별 추론(중간 사고 과정)을 출력하도록 유도하는 프롬프트 기법이다. 중간 토큰을 통해 추론 과정이 길어지며 복잡한 다단계 문제에서 성능 향상을 도모하지만, 멀티모달 입력에서는 불필요한 연산과 산만함을 야기할 수 있다.
검증된 보상 기반 강화학습(RLVR)(Reinforcement Learning with Verified Rewards (RLVR))
RLVR는 생성된 CoT와 답안의 품질을 외부 검증으로 평가해 보상을 부여하는 학습 전략이다. 이 방식은 더 긴 CoT와 반성적 행동(reflection)을 유도해 수학적 추론 성능을 끌어올렸으나, 멀티모달 전반으로 일반화되지는 않았다.
시각적 반성(Visual Reflection)
시각적 반성은 모델이 이미지 해석에 대해 의심·재검토·재해석을 언어적으로 표현하는 행동이다. 멀티스텝 CoT에서 이미지 정보를 지속적으로 재검토해야 정확한 시각기반 추론이 가능하다.
교차 어텐션(Cross-Attention)
교차 어텐션은 텍스트 토큰이 시각(이미지) 임베딩에 주의를 할당하는 메커니즘이다. CoT 생성 중 교차 어텐션이 시각 토큰에서 텍스트 토큰으로 편향되면 이미지 정보가 점진적으로 무시되어 시각적 반성이 약화된다.
멀티모달 추론 프로브(Multimodal Reasoning Probe)
프로브는 원문 문제에서 시각적 분석을 필요로 하는 중간 단계(visual probe)와 텍스트만으로 해결 가능한 중간 단계(textual probe)를 분리해 성능 기여도를 측정하는 평가 도구이다. 시각·문자 성능 격차와 상관관계를 분석하는 데 활용됐다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 21.수집 2026. 06. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.