TL;DR
언어모델의 검증 가능한 보상 학습에서 동일한 프롬프트에 대해 여러 답안을 샘플링하는 관행은 모델 불확실성 측정과 학습 신호 형성의 핵심이다. 이 논문은 그 그룹 내 정답표시의 표준편차 σ가 정규화 항이 아니라 학습 신호의 크기 자체이며, σ를 어떻게 처리하느냐에 따라 GRPO·Dr. GRPO·DAPO의 목적함수와 학습 궤적이 달라진다고 수식적·실험적으로 보였다. 실무적으로는 그룹 크기 선택과 동적 샘플링 여부가 학습 예산과 난이도별 가중치 배분을 결정하는 기준이 된다.
왜 중요한가
언어모델의 검증 가능한 보상 학습에서 동일한 프롬프트에 대해 여러 답안을 샘플링하는 관행은 모델 불확실성 측정과 학습 신호 형성의 핵심이다. 이 논문은 그 그룹 내 정답표시의 표준편차 σ가 정규화 항이 아니라 학습 신호의 크기 자체이며, σ를 어떻게 처리하느냐에 따라 GRPO·Dr. GRPO·DAPO의 목적함수와 학습 궤적이 달라진다고 수식적·실험적으로 보였다. 실무적으로는 그룹 크기 선택과 동적 샘플링 여부가 학습 예산과 난이도별 가중치 배분을 결정하는 기준이 된다.
핵심 기여
그룹 표준편차 항등식의 엄밀 증명
한 프롬프트에서 G개의 샘플을 얻고 그 중 k개가 정답일 때 GRPO의 per-prompt 업데이트가 정확히 그룹 표준편차 σ = √{k(G−k)}/G에 정답·오답 평균 점수 차이를 곱한 형태라는 정리(식 (4))를 도출했다. 이 항등식은 기준선(baseline)에 무관하며 임의 차원에서도 성립하는 등 일반성이 확보되어 있다. 항등식은 GRPO의 이론적 해석을 단순한 정규화 관점에서 기울기 크기 관점으로 전환시킨다.
유한 그룹에 대한 정확한 기댓값과 아르크사인 극한
단일 그룹 항등식을 k∼Binomial(G,p)으로 평균내어 유한 G에 대한 정확한 이항합(식 (6))을 제시했고 G→∞에서의 아르크사인 변환 기울기 √{p(1−p)}로 수렴함을 보였다. 또한 유한 G에서의 첫 번째 보정항 1−1/(8Gp(1−p))을 도출하여 큰 그룹 극한과의 차이를 정량화했다. 이 결과는 그룹 크기가 제한된 실제 훈련에서 GRPO가 어떻게 Dr. GRPO와 다른 목적을 갖는지를 수치적으로 연결한다.
그룹 크기 법칙과 샘플 예산의 난이도 의존성
목표 신호 충실도 φ≥1−ε를 달성하기 위해 필요한 그룹 크기 G⋆≈1/(8ε p(1−p))라는 닫힌형을 제시했다. 이 법칙은 같은 예산이 난이도별로 매우 다른 효과를 낳음을 수치로 보여주며 예컨대 p=0.5는 G≈11으로 95% 충실도를 얻지만 p=0.05는 G≈69가 필요함을 계산했다. 따라서 단일 균일 그룹 크기 설정은 중간 난이도에는 과투자, 꼬리 난이도에는 과소투자의 문제를 낳는다.
무응답(무효) 그룹 비율의 정확한 닫힌형
그룹이 완전히 정답이거나 완전히 오답일 확률인 silent-group rate가 p^G+(1−p)^G라는 단순한 닫힌형으로 표현되며 DAPO의 동적 샘플링이 이 무응답 질량을 과대표본추출·제거하는 방식임을 수식적으로 연결했다. 실제 Big-Math 분포에서 G=8일 때 무응답 비율이 약 44%임을 계산하고 64롤아웃 로그로부터의 부분표본화와도 수치적으로 일치시켰다. 이 값은 학습에서 '신호가 전혀 없는' 업데이트 비율을 직접적으로 제공한다.
실험적 검증과 재현 가능성 확보
Big-Math 난이도 분포(N=215,608)와 재현 가능한 제어된 실험(M=6,000 Bernoulli-logit 프롬프트, G=8)을 사용하여 닫힌형 예측들이 학습 동역학(무응답 비율, 난이도별 기울기 질량, 난이도 편향)에 실제로 반영된다는 것을 보였다. 제어 실험에서 무응답 예측은 R^2=0.999로 일치했고 GRPO가 처음 어려운 문제군을 Dr. GRPO보다 더 빠르게 올리는 동적 효과가 관찰되었다. 모든 코드와 데이터는 공개된 GitHub 저장소로 재현 가능하게 제공되었다.
관련 Figure

해당 플롯은 Corollary 1의 1−1/(8Gp(1−p)) 보정항이 실제로 G값에 민감하게 작동함을 보여준다. 중간 난이도에서는 비교적 작은 G로도 큰 충실도를 얻지만 극단 난이도에서는 G 증가에 따른 보정이 중요함을 확인시킨다. 이 시각자료는 그룹 크기 법칙을 실무적 예산 산정에 바로 적용할 수 있게 만든다.
그룹 크기 G에 따른 기대 기울기 실현률과 유한-그룹 감쇠 법칙을 플롯한 그림으로 작은 G에서의 감쇠가 시각화되어 있다.
핵심 아이디어 이해하기
강화학습 환경에서 자동 채점기는 각 샘플 생성에 대해 0 또는 1의 이진 보상을 반환하며 동일 프롬프트에 대해 여러 답안을 샘플링하는 이유는 모델의 불확실성을 측정하고 정답·오답 간 비교를 가능하게 하기 때문이다. 그룹 내에 정답과 오답이 섞여 있을 때만 비교가 가능하여 학습신호가 형성되고, 모든 시도가 동일하면 내부 대비가 없어 학습 신호가 소멸한다. 따라서 그룹 내 불일치량이 곧 한 프롬프트의 즉시 학습 신호이다.
관련 Figure

이 그림은 항등식 g=σ( s̄_+−s̄_− )의 스칼라 특수형을 시각화하여 동일 그룹 내 정답 분할이 곧 기울기 크기를 결정함을 직접적으로 나타낸다. 서로 다른 baseline 값을 대응해도 같은 곡선 위에 결과가 놓이는 점은 baseline 불감성을 경험적으로 확증한다. 따라서 그룹의 내부 분할 정도가 학습 신호의 양이라는 논문의 주요 주장과 직접적으로 연결된다.
그룹 내 정답 k에 따른 per-prompt 기울기 크기 g(k)=√{k(G−k)}/G가 k=0 또는 k=G에서 0이고 중간 분할에서 최대가 됨을 보여주는 플롯이다.

이 도표는 GRPO가 아르크사인 기반의 변환에 따라 극단 난이도에 더 큰 한계 기여를 할당하고 Dr. GRPO는 균등 가중치를 부여함을 분명히 보여준다. w(p)의 욕조(bathtub) 형태는 왜 GRPO가 극단적 문제에 더 많은 훈련압을 가하는지를 정량적으로 연결한다. 이 비교는 표준화의 목적함수 변경 효과를 직관적으로 전달한다.
GRPO와 Dr. GRPO의 암묵적 목적함수와 per-prompt 기울기 가중치 w(p)=1/√{p(1−p)} 대 1의 비교를 보이는 도표이다.
방법론
논문은 한 프롬프트에 대해 G개의 답안을 샘플링하고 각 답안에 대해 ∇θ log π_θ(y_i)인 score를 계산하는 표준적인 정책 기울기 정리로 출발한다. 이진 보상(R_i∈{0,1})을 가정하면 그룹 평균 μ=k/G과 그룹 표준편차 σ=√{k(G−k)}/G가 정확히 닫힌형으로 주어지며 GRPO의 표준화된 이득(Â_i=(R_i−μ)/σ)을 per-prompt score들과 결합해 합을 취하면 항등식 g=σ( s̄+−s̄_− )이 도출된다. 이 도출은 기준선(baseline) 선택에 무관하며, k=0 또는 k=G일 때 σ=0으로 g=0이 됨을 명확히 한다.
관련 Figure

이 그림은 silent-group rate의 p 의존성을 명확히 드러내어 매우 쉬운 문제와 매우 어려운 문제에서 무응답 비율이 급증함을 나타낸다. DAPO가 이러한 무응답 그룹을 제거하는 전략이 무응답 질량을 다루는 직접적 방법임을 이 도표로 이해할 수 있다. 따라서 동적 샘플링 정책의 구조적 효과가 시각적으로 확인된다.
여러 G 값에 대해 per-prompt 성공확률 p의 함수로 무응답 그룹 비율 p^G+(1−p)^G이 어떻게 변화하는지를 보여주는 곡선이다.
주요 결과
이론적으로는 식(4)의 그룹 표준편차 항등식이 모든 차원에서 성립하며 식(6)으로 표현되는 k에 대한 이항 평균이 유한 G에서의 정확한 기대 기울기를 제공한다. G→∞ 극한은 아르크사인 변환 2·arcsin√p의 기울기 √{p(1−p)}로 수렴하고 유한 G의 첫번째 보정항은 1−1/(8Gp(1−p))로 정량화되어 실전 그룹 크기에서의 감쇠를 설명한다. 실험적으로 Big-Math 코퍼스(N=215,608)에서 GRPO의 표준화는 극단 난이도에 대한 기울기 예산을 13.9%에서 24.7%로 재배분했으며 G=8에서 무응답 비율은 약 44%로 계산되었고 제어된 훈련 실험(M=6,000)에서 무응답 예측은 R^2=0.999 수준으로 실제 반복학습 동역학을 추적했다.
관련 Figure

이 그림은 실제 난이도 분포를 사용한 닫힌형 예측이 DAPO의 기록된 로그와 유사한 시간 변화를 보인다는 점을 강조한다. 특히 훈련 중 전체 정답(모두 정답) 질량이 증가하면서 DAPO의 제거 대상이 되는 비율이 어떻게 변화하는지 정량적으로 연결된다. 따라서 이 플롯은 이론적 닫힌형이 대규모 난이도 코퍼스에서 실무 로그로 바로 매핑됨을 시사한다.
Big-Math 데이터 분포에 기반한 시간 경과 추적과 DAPO의 로그(평균@32)와 닫힌형 예측 간의 일치성 및 전체 정답 질량 곡선을 보여주는 그림이다.

이 그림은 실제 난이도 분포가 양극단(완전 실패·완전 성공)에 질량을 가지고 있어 표준화가 재분배에 큰 영향을 미친다는 사실을 보여준다. GRPO의 가중치는 극단 난이도에 더 많은 기울기 예산을 몰아주어 실제 학습 궤적에서 어려운 문제의 가중치를 증가시키는 기계적 원인을 제공한다. 따라서 Big-Math 데이터에서의 수치적 예시는 이론적 닫힌형의 실무적 함의를 명확히 한다.
Big-Math의 경험적 풀(hat p) 히스토그램과 GRPO·Dr. GRPO에 따른 기울기 예산 분배를 보여주는 그림이다.
기술 상세
전체 아키텍처는 단일 프롬프트 x에 대해 정책 π_θ가 G개의 답변을 샘플링하고 자동 채점기가 각 답변에 대해 R_i∈{0,1}을 반환하는 RLVR 설정이다. 각 답변의 score s_i=∇θ log π_θ(y_i)와 그룹 내 정답 집합·오답 집합의 평균 s̄+, s̄_−를 정의하고 표준화된 이득을 집계하면 per-prompt 업데이트가 g=(1/G)∑i Â_i s_i임을 보이는데, 이 합이 닫힌형으로 σ(s̄+−s̄_−)이 됨을 엄밀히 도출했다. 이 수식은 baseline 선택에 불감하며 임의의 파라미터 차원에 대해 성립하므로 Transformer 기반 LLM의 토큰 수준에 브로드캐스트된 이득에도 그대로 적용될 수 있다.
관련 Figure

로그 스케일 플롯은 w(p)의 발산 특성이 p→0,1에서 심각함을 강조하여 GRPO가 극단 난이도에 대해 무한대에 가까운 한계 민감도를 갖는 양상을 보여준다. 이 특성은 무응답 그룹이 많은 꼬리 영역에서 표준화가 기울기 분배를 크게 왜곡하는 원인임을 수학적으로 보강한다. 연구의 난이도 편향 논의를 시각적으로 보완한다.
GRPO의 기울기 가중치 w(p)=1/√{p(1−p)}가 로그 스케일에서 p에 따라 어떻게 변하는지와 Dr. GRPO의 상수 가중치와의 차이를 표시한 그래프이다.
한계점
증명과 정량화는 이진 보상(R_i∈{0,1})과 온폴리시 첫 스텝 업데이트의 가정 하에 이루어졌다. 클리핑, KL 페널티, 오프폴리시 성분, 연속적 보상 혹은 비이진 보상 체계에 대한 동일한 단일그룹 항등식 일반화는 본문에서 제외되어 후속 작업이 필요하다. 또한 대형 언어모델의 전체 훈련 루프에서 로그를 수집해 난이도별 기울기 질량을 직접 측정하는 추가 실험이 권장된다.
실무 활용
연구가 제시한 닫힌형은 훈련 로그에서 각 프롬프트의 무응답 확률과 실효 기울기 분배를 사전 계산해 학습 예산과 샘플링 전략을 설계하는 데 직접 쓰일 수 있다. 공개된 GitHub 저장소는 진단 API와 재현 스크립트를 제공하여 실제 LLM 훈련 파이프라인에 통합 가능한 상태로 구성되었다. 코드가 공개되어 있으므로 그룹 크기 선택, DAPO식 동적 샘플링 도입, 또는 표준화 여부를 실험적으로 비교하는 작업에 즉시 활용 가능하다.
- 훈련 초기 단계에서 그룹 크기 G를 난이도별로 적응시키는 샘플 예산 계획 수립
- DAPO 스타일의 동적 샘플링을 적용해 무응답 그룹에 대한 계산 낭비를 줄이는 파이프라인 구성
- GRPO와 Dr. GRPO의 성능·일반화·학습 궤적 차이를 비교하는 통제된 실험 설계
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Group Standard Deviation
- — 한 프롬프트에 대해 모델이 동일한 입력으로 여러 번 생성한 답안의 정답표시(0/1)의 표준편차로, 정답과 오답의 내부 불일치를 측정하며 GRPO의 정규화 항과 학습 신호 크기를 동시에 결정한다.
- RLVR
- — 자동 채점기가 각 생성 답안을 0 또는 1로 판정하는 환경에서 정책이 여러 번 샘플을 생성해 얻은 이진 보상으로 정책을 갱신하는 설정으로, 그룹 내 불일치가 학습에 직접적으로 연결된다.
- Arcsine Transform
- — 이항 비율의 분산을 안정화하는 고전적 변환으로, G→∞ 극한에서 GRPO의 정규화가 암묵적으로 따르는 목적함수 2·arcsin(√p)의 기울기를 결정한다.
- Silent Group
- — 그룹 샘플링에서 모든 시도가 동일한 정답표시(모두 맞거나 모두 틀림)를 보이는 경우로 표준편차 σ=0이 되어 해당 그룹이 학습 신호를 제공하지 못하는 상태이다.
- Difficulty Bias
- — 정규화 연산이 극단적 난이도(매우 쉬움·매우 어려움)에 상대적으로 더 큰 기울기 가중치를 부여하는 현상으로, GRPO의 1/√(p(1-p)) 가중치가 그 원인이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.