본문으로 건너뛰기

GRPO, Dr. GRPO 및 DAPO는 하나의 수에 대한 세 연산: 그룹 표준편차 항등식

언어모델의 검증 가능한 보상 학습에서 동일한 프롬프트에 대해 여러 답안을 샘플링하는 관행은 모델 불확실성 측정과 학습 신호 형성의 핵심이다. 이 논문은 그 그룹 내 정답표시의 표준편차 σ가 정규화 항이 아니라 학습 신호의 크기 자체이며, σ를 어떻게 처리하느냐에 따라 GRPO·Dr. GRPO·DAPO의 목적함수와 학습 궤적이 달라진다고 수식적·실험적으로 보였다. 실무적으로는 그룹 크기 선택과 동적 샘플링 여부가 학습 예산과 난이도별 가중치 배분을 결정하는 기준이 된다.

용어 해설

그룹 표준편차(Group Standard Deviation)
한 프롬프트에 대해 모델이 동일한 입력으로 여러 번 생성한 답안의 정답표시(0/1)의 표준편차로, 정답과 오답의 내부 불일치를 측정하며 GRPO의 정규화 항과 학습 신호 크기를 동시에 결정한다.
검증 가능한 보상 강화학습(RLVR)
자동 채점기가 각 생성 답안을 0 또는 1로 판정하는 환경에서 정책이 여러 번 샘플을 생성해 얻은 이진 보상으로 정책을 갱신하는 설정으로, 그룹 내 불일치가 학습에 직접적으로 연결된다.
아르크사인 변환(Arcsine Transform)
이항 비율의 분산을 안정화하는 고전적 변환으로, G→∞ 극한에서 GRPO의 정규화가 암묵적으로 따르는 목적함수 2·arcsin(√p)의 기울기를 결정한다.
무응답 그룹(Silent Group)
그룹 샘플링에서 모든 시도가 동일한 정답표시(모두 맞거나 모두 틀림)를 보이는 경우로 표준편차 σ=0이 되어 해당 그룹이 학습 신호를 제공하지 못하는 상태이다.
난이도 편향(Difficulty Bias)
정규화 연산이 극단적 난이도(매우 쉬움·매우 어려움)에 상대적으로 더 큰 기울기 가중치를 부여하는 현상으로, GRPO의 1/√(p(1-p)) 가중치가 그 원인이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 30.수집 2026. 07. 03.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.