본문으로 건너뛰기

실패 연쇄 해소: 단계 인지 강화학습을 통한 의료 멀티모달 추론

의료 영상 질의응답은 다단계 추론 과정에서 초기에 발생한 오류가 이후 단계로 전파되어 최종 예측을 왜곡하는 경향이 있다. 기존의 결과 중심(post-training) 최적화는 최종 정답 신호만 사용해 어떤 중간 단계가 문제였는지 밝히기 어렵기 때문에 실제 임상 응용에서 신뢰성 확보에 한계가 있다. MRPO는 단계별 보상과 어드밴티지 재형성을 통해 초기 실패를 표적 교정함으로써 추론의 품질과 최종 정확도를 동시에 개선한다.

용어 해설

첫 번째 실패 지점(First Failure Point (FFP))
추론 트레이스에서 첫 번째로 유효하지 않은 문장형 추론 단계의 상대적 위치를 의미한다. 총 K단계 중 k번째 실패가 발생했을 때 FFP = k/K로 계산되며, 값이 작을수록 실패가 초기에 발생했다는 것을 나타낸다. 이 지표는 실패 전파(실패 캐스케이드)의 시작점을 정량화하여 어디에 학습 신호를 집중해야 하는지 판단하는 데 중요하다.
실패 누적 비율(Failure Accumulation Rate (FAR))
첫 번째 실패 이후 남은 추론 단계들에서 실패한 단계들의 비율로 정의된다. 수식은 FAR = (# first failure 이후 실패 단계 수) / (# first failure 이후 전체 단계 수)로 계산된다. 이 값은 초기 실패가 이후 단계들로 얼마나 전파되는지를 정량적으로 보여주어 복구 능력을 평가하는 데 사용된다.
어드밴티지 재형성(Advantage Shaping)
GRPO 기반의 그룹 정규화된 advantage를 토큰·단계 수준에서 재가중하는 기법을 의미한다. 본 논문에서는 최종 답이 틀렸을 때 이전 실패 단계의 토큰에 대해 지수적으로 큰 음의 어드밴티지를 부여하는 방식으로 구현되어 초기 실패를 강하게 억제한다. 이렇게 하면 실패를 일으킨 특정 단계에 더 직접적인 학습 신호가 전달되어 크레딧 할당이 세분화된다.
단계별 추론 보상(Step-wise Reasoning Process Reward)
문장 단위로 분할된 각 추론 단계에 대해 Gold Alignment와 Answer Contribution 두 기준 중 하나라도 만족하면 1을 부여하는 이진 과정 보상이다. 이 보상은 최종 답과 독립적으로 각 단계의 유효성을 평가해 추론 과정 자체를 감독하도록 설계되었다. 단계별 보상은 MRPO의 어드밴티지 재형성에서 어느 단계가 잘못되었는지를 판단하는 핵심 신호로 사용된다.
LLM 평가자(LLM-as-Judge)
모델 출력의 정답 여부와 각 추론 단계의 유효성을 판정하기 위해 외부 대형 언어 모델(GPT-5-mini)을 평가자 역할로 사용한 접근이다. 정답 일치도와 단계 정합성 등을 자동화된 프롬프트로 이진 레이블링하여 대규모의 문장단위 보상을 생성한다. 인간 평가와의 정합성을 확인해 자동화된 과정 보상으로 활용했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 30.수집 2026. 07. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.