용어 해설
- 첫 번째 실패 지점(First Failure Point (FFP))
- — 추론 트레이스에서 첫 번째로 유효하지 않은 문장형 추론 단계의 상대적 위치를 의미한다. 총 K단계 중 k번째 실패가 발생했을 때 FFP = k/K로 계산되며, 값이 작을수록 실패가 초기에 발생했다는 것을 나타낸다. 이 지표는 실패 전파(실패 캐스케이드)의 시작점을 정량화하여 어디에 학습 신호를 집중해야 하는지 판단하는 데 중요하다.
- 실패 누적 비율(Failure Accumulation Rate (FAR))
- — 첫 번째 실패 이후 남은 추론 단계들에서 실패한 단계들의 비율로 정의된다. 수식은 FAR = (# first failure 이후 실패 단계 수) / (# first failure 이후 전체 단계 수)로 계산된다. 이 값은 초기 실패가 이후 단계들로 얼마나 전파되는지를 정량적으로 보여주어 복구 능력을 평가하는 데 사용된다.
- 어드밴티지 재형성(Advantage Shaping)
- — GRPO 기반의 그룹 정규화된 advantage를 토큰·단계 수준에서 재가중하는 기법을 의미한다. 본 논문에서는 최종 답이 틀렸을 때 이전 실패 단계의 토큰에 대해 지수적으로 큰 음의 어드밴티지를 부여하는 방식으로 구현되어 초기 실패를 강하게 억제한다. 이렇게 하면 실패를 일으킨 특정 단계에 더 직접적인 학습 신호가 전달되어 크레딧 할당이 세분화된다.
- 단계별 추론 보상(Step-wise Reasoning Process Reward)
- — 문장 단위로 분할된 각 추론 단계에 대해 Gold Alignment와 Answer Contribution 두 기준 중 하나라도 만족하면 1을 부여하는 이진 과정 보상이다. 이 보상은 최종 답과 독립적으로 각 단계의 유효성을 평가해 추론 과정 자체를 감독하도록 설계되었다. 단계별 보상은 MRPO의 어드밴티지 재형성에서 어느 단계가 잘못되었는지를 판단하는 핵심 신호로 사용된다.
- LLM 평가자(LLM-as-Judge)
- — 모델 출력의 정답 여부와 각 추론 단계의 유효성을 판정하기 위해 외부 대형 언어 모델(GPT-5-mini)을 평가자 역할로 사용한 접근이다. 정답 일치도와 단계 정합성 등을 자동화된 프롬프트로 이진 레이블링하여 대규모의 문장단위 보상을 생성한다. 인간 평가와의 정합성을 확인해 자동화된 과정 보상으로 활용했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




