섹션별 상세
전통적인 강화학습의 보상 신호 불확실성은 모델이 잘못된 방향으로 최적화되는 보상 해킹 문제를 야기한다. RLVR은 인간의 주관적 평가 대신 프로그래밍된 규칙으로 정답을 검증하여 투명하고 객관적인 피드백 루프를 구축한다. 이를 통해 모델은 모호한 지침 대신 명확한 성공 기준을 바탕으로 반복적인 성능 개선이 가능하다.
GRPO 알고리즘은 전체 데이터가 아닌 그룹 내 상대적 비교를 통해 정책을 업데이트함으로써 학습의 안정성을 높인다. 각 프롬프트에 대해 여러 응답을 생성하고 그룹 내에서 더 나은 응답의 확률을 높이는 방식으로 작동하여 분산을 줄이고 수렴을 가속화한다. 특히 수학적 추론과 같이 정답 경로가 다양한 작업에서 균형 잡힌 성능 향상을 이끌어낸다.
수학적 추론 학습을 위해 응답의 구조를 확인하는 형식 보상과 정답의 수치를 대조하는 정확도 보상의 이중 체계를 구축한다. 정규표현식을 사용하여 응답 내 특정 패턴을 감지하고 부동 소수점 오차를 고려한 정밀도 비교를 통해 보상을 산출한다. 이 방식은 최대 1.5점의 결합 보상을 제공하여 모델이 올바른 형식과 정확한 답을 동시에 학습하도록 유도한다.
python
#Correctness reward function
def correctness_reward_func_qa(completions, final_answer, **kwargs):
rewards = []
for completion, ground_truth in zip(completions, final_answer):
try:
match = re.search(r'####.*?([\d,]+(?:\.\d+)?)', completion)
if match:
answer = match.group(1)
for remove_char in [',', '$', '%', 'g']:
answer = answer.replace(remove_char, '')
if abs(float(answer)-float(ground_truth)) < 1e-3:
rewards.append(1.0)
else:
rewards.append(0.0)
else:
rewards.append(0.0)
except ValueError:
rewards.append(0.0)
return rewards추출된 수치 정답과 실제 정답을 비교하여 수학적 정확도에 따라 1.0 또는 0.0의 보상을 부여하는 함수
실험 결과 8-shot 예시를 포함한 GRPO 학습 모델은 기본 모델의 11% 정확도 대비 41%로 성능이 급격히 향상됐다. 특정 개수 이상의 예시(4-shot 이상)가 주어질 때 추론 능력이 활성화되는 비선형적 스케일링 패턴이 관찰됐다. 이는 모델이 그룹 비교를 통해 최적의 추론 경로를 선택하는 법을 학습했음을 시사하며 검증 가능한 도메인에서의 강력한 효용성을 보여준다.
근거
- 8-shot GRPO 학습 모델은 기본 모델 대비 3.7배 향상된 41%의 정확도를 달성했다. — Results 섹션 및 Comprehensive Evaluation Results 표
- 0-shot과 2-shot 설정에서는 기본 모델보다 낮은 성능을 보였으나 4-shot부터 성능이 급격히 개선되었다. — Results 섹션의 Mathematical Reasoning Performance 차트 분석
용어 해설
- 그룹 상대 정책 최적화(GRPO)
- — 데이터 전체가 아닌 그룹 내에서 성능을 비교하여 모델을 학습시키는 강화학습 알고리즘이다. 훈련 데이터의 분산을 줄이고 수렴 속도를 높여 다양한 카테고리에서 일관된 성능을 내도록 돕는다.
- 검증 가능한 보상 기반 강화학습(RLVR)
- — 수학 문제나 코드 생성처럼 정답이 객관적으로 확인 가능한 작업에서 규칙 기반의 피드백을 제공하는 방식이다. 인간의 주관적 평가 대신 프로그래밍된 함수로 점수를 매겨 보상 해킹을 방지한다.
- 양자화된 저순위 적응(QLoRA)
- — 모델 가중치를 4비트로 양자화한 후 저순위 행렬만 학습시켜 메모리 사용량을 획기적으로 줄이는 미세 조정 기법이다. 적은 컴퓨팅 자원으로도 대규모 언어 모델을 효율적으로 학습할 수 있게 한다.
- 초등 수학 8K 데이터셋(GSM8K)
- — 8,500개의 초등 수준 수학 문장제로 구성된 벤치마크 데이터셋이다. 다단계 산술 추론과 자연어 이해 능력을 평가하며 정답이 수치로 명확해 검증 가능한 학습에 자주 쓰인다.
기술
- Qwen2.5
- GRPO
- QLoRA
- Amazon SageMaker
- PyTorch
- Hugging Face Accelerate
- DeepSpeed
활용 사례
- 수학 문제 풀이 모델 최적화
- 실행 기반 코드 생성 모델 학습
- 도메인 특화 용어 준수 텍스트 생성
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 08.수집 2026. 05. 08.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.