GRPO 기반 온라인 RL
검증기 기반 Online RL에서 같은 과제에 대해 K개 롤아웃을 샘플링하고 그룹 상대 이점(분산 정규화된 리턴)을 계산해 정책을 갱신하는 방식으로 장기 궤적 성공률을 최적화합니다.