본문으로 건너뛰기
HF Daily Papers조회 1

Faithful GRPO: 제약 조건 정책 최적화를 통한 멀티모달 언어 모델의 시각적 공간 추론 능력 향상

최근 멀티모달 모델들이 정답은 맞히더라도 추론 과정(CoT)에서 이미지와 무관한 설명을 하거나 앞뒤가 안 맞는 말을 하는 '불성실한 추론' 문제가 심각하다. 이 논문은 강화학습 과정에서 논리적 일관성과 시각적 근거를 '강력한 제약 조건'으로 설정하여, 모델이 정답만 맞히는 편법을 쓰지 못하게 하고 추론의 품질과 정확도를 동시에 높이는 방법을 제시한다.

용어 해설

그룹 상대 정책 최적화(GRPO)
DeepSeek-R1에서 제안된 강화학습 기법으로, 별도의 가치 모델(Critic) 없이 동일 프롬프트에서 생성된 여러 응답(그룹)의 상대적 보상을 비교하여 정책을 업데이트하는 방식이다. 계산 효율성이 높고 추론 능력 강화에 효과적이다.
라그랑주 쌍대 상승법(Lagrangian Dual Ascent)
제약 조건이 있는 최적화 문제를 해결하기 위한 수학적 기법이다. 제약 조건을 위반할 때마다 '라그랑주 승수'라는 가중치를 높여 모델이 해당 조건을 만족하도록 강제하며, 이를 통해 여러 목표 간의 균형을 자동으로 조절한다.
시각적 근거 제시(Visual Grounding)
멀티모달 모델이 텍스트 응답을 생성할 때, 이미지 내의 구체적인 객체나 영역(Bounding Box)과 연결 짓는 능력이다. 모델이 단순히 짐작해서 답하는 것이 아니라 실제 시각적 증거에 기반해 추론하고 있음을 보장한다.
사고의 사슬(Chain-of-Thought)
모델이 최종 정답을 내놓기 전에 단계적인 추론 과정을 텍스트로 생성하도록 유도하는 기법이다. 복잡한 논리적 문제를 해결하는 데 도움을 주지만, 생성된 추론 과정이 정답과 모순되거나 이미지 내용과 다를 수 있는 '불성실성' 문제가 발생하기도 한다.

코드 예제

python
A_FGRPO(o_i_j) = A_task(o_i_j) + sum_{k in {C,S,G}} lambda_k * A_k(o_i_j)

FGRPO의 최종 어드밴티지(Advantage) 계산식으로, 기본 과업 보상에 논리적 일관성(C), 시각적 근거(S, G) 제약 조건의 어드밴티지를 라그랑주 승수와 결합하는 예시

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 10.수집 2026. 04. 11.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.