용어 해설
- 그룹 표준편차(Group Standard Deviation)
- — 한 프롬프트에 대해 모델이 동일한 입력으로 여러 번 생성한 답안의 정답표시(0/1)의 표준편차로, 정답과 오답의 내부 불일치를 측정하며 GRPO의 정규화 항과 학습 신호 크기를 동시에 결정한다.
- 검증 가능한 보상 강화학습(RLVR)
- — 자동 채점기가 각 생성 답안을 0 또는 1로 판정하는 환경에서 정책이 여러 번 샘플을 생성해 얻은 이진 보상으로 정책을 갱신하는 설정으로, 그룹 내 불일치가 학습에 직접적으로 연결된다.
- 아르크사인 변환(Arcsine Transform)
- — 이항 비율의 분산을 안정화하는 고전적 변환으로, G→∞ 극한에서 GRPO의 정규화가 암묵적으로 따르는 목적함수 2·arcsin(√p)의 기울기를 결정한다.
- 무응답 그룹(Silent Group)
- — 그룹 샘플링에서 모든 시도가 동일한 정답표시(모두 맞거나 모두 틀림)를 보이는 경우로 표준편차 σ=0이 되어 해당 그룹이 학습 신호를 제공하지 못하는 상태이다.
- 난이도 편향(Difficulty Bias)
- — 정규화 연산이 극단적 난이도(매우 쉬움·매우 어려움)에 상대적으로 더 큰 기울기 가중치를 부여하는 현상으로, GRPO의 1/√(p(1-p)) 가중치가 그 원인이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






