본문으로 건너뛰기

Insight-V++: 멀티모달 대형 언어 모델을 활용한 고도화된 롱체인 시각적 추론을 향하여

기존 멀티모달 모델은 복잡한 시각적 추론 데이터의 부족으로 인해 단계별 문제 해결 능력이 떨어지는 한계가 있었다. 이 논문은 인간의 개입 없이 고품질 추론 데이터를 생성하고, 추론과 요약을 분리한 멀티 에이전트 구조 및 새로운 강화학습 알고리즘을 통해 이미지와 비디오 영역 모두에서 추론 성능을 획기적으로 개선했다.

용어 해설

사고의 사슬(Chain-of-Thought)
모델이 복잡한 문제를 해결할 때 중간 단계의 추론 과정을 순차적으로 생성하도록 유도하는 기법이다. 이를 통해 결과 도출 과정을 투명하게 만들고 논리적 오류를 줄여 복잡한 추론 성능을 높이는 역할을 한다.
그룹 상대 정책 최적화(GRPO)
별도의 비판(Critic) 모델 없이 동일한 질문에 대한 여러 출력값의 상대적 보상을 비교하여 정책을 업데이트하는 강화학습 알고리즘이다. 계산 효율성이 높고 학습이 안정적이며 DeepSeek-R1 등 최신 모델에서 널리 사용된다.
시공간 추론(Spatial-Temporal Reasoning)
이미지 내 객체의 위치 관계(공간)와 비디오 내 시간에 따른 변화(시간)를 동시에 파악하여 논리적으로 분석하는 능력이다. 비디오 이해와 자율 주행 등 동적인 환경 분석에 필수적인 기술이다.
직접 선호도 최적화(DPO)
보상 모델을 별도로 학습시키지 않고 사람이 선호하는 답변 쌍을 직접 사용하여 모델을 정렬하는 기법이다. RLHF보다 구조가 단순하여 효율적이지만, 데이터 분포 변화에 민감할 수 있다는 특징이 있다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 19.수집 2026. 03. 25.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.