챕터별 상세
RLVR의 핵심 요약과 샘플링 효율성
RLVR은 코딩이나 수학처럼 정답이 명확한 작업에서 모델의 정답률을 높이는 데 매우 효과적이다. 하지만 이는 모델이 전혀 몰랐던 추론 방식을 배우는 것이 아니라, 이미 알고 있던 여러 경로 중 정답으로 가는 경로를 더 자주 선택하게 만드는 '샘플링 효율성'의 개선이다. 실험 데이터에 따르면 베이스 모델을 충분히 많이 샘플링(Pass@K)할 경우 RL 학습 모델과 거의 동일한 정답을 찾아낼 수 있음이 확인됐다.
추론 경계의 한계: RLVR vs 지식 증류
RLVR은 모델이 이미 가진 능력을 강화하는 '오래된 개에게 기존 기술을 더 잘하게 가르치는 것'과 유사하다. 반면 지식 증류(Distillation)는 더 뛰어난 모델의 추론 경로를 직접 학습함으로써 모델의 추론 경계 자체를 확장하는 효과를 가진다. RL은 모델 내부의 잠재적 분포 내에서만 작동하므로, 베이스 모델이 아예 해결 불가능한 문제는 RL만으로 해결할 수 없다는 것이 핵심이다.
체인 오브 쏘트(CoT)의 유효성 검증
단순히 정답만 맞히는 '운 좋은 추측'과 실제 '논리적 추론'을 구분하기 위해 생성된 CoT 경로를 전수 조사했다. 분석 결과 RL로 학습된 모델의 정답 경로는 대부분 논리적으로 타당한 추론 단계를 포함하고 있었다. 이는 RL이 무작위 추측을 조장하는 것이 아니라, 베이스 모델 내부에 숨겨져 있던 올바른 추론 경로를 수면 위로 끌어올려 고착화시키는 과정임을 입증한다.
text
Please reason step by step, and put your final answer within \boxed{}.
<|thought|>
...
<|answer|>모델에게 단계별 추론(CoT)을 유도하고 정답을 특정 형식으로 출력하도록 지시하는 RLVR 학습용 프롬프트 템플릿
모델 크기와 스케일링 법칙의 영향
소형 모델(1.5B)과 중대형 모델(7B 이상)에서 RL의 효과가 어떻게 다른지 논의했다. 소형 모델은 베이스 상태에서 추론 능력이 극히 낮아 RL을 통한 개선폭이 제한적일 수 있지만, 일정 수준 이상의 체급을 가진 모델에서는 RL을 통한 효율성 개선이 뚜렷하게 관찰된다. 결국 베이스 모델의 사전 학습 수준이 RL 성과의 임계치를 결정하며, 체급이 클수록 RL이 인출할 수 있는 잠재적 추론 경로가 풍부해진다.
스케일링 법칙에 따라 모델 파라미터가 커질수록 베이스 모델이 보유한 잠재적 지식의 양이 기하급수적으로 늘어난다.
용어 해설
- 검증 가능한 보상을 활용한 강화학습(RLVR)
- — 코딩 테스트 통과나 수학 문제 정답처럼 결과의 정오표판이 명확한 보상을 활용해 모델을 학습시키는 강화학습 기법이다. 모델이 생성한 결과값이 사전에 정의된 유닛 테스트나 정답지와 일치할 때만 보상을 주어 논리적 정확도를 높인다.
- 샘플링 효율성(Sampling Efficiency)
- — 모델이 정답을 맞히기 위해 시도해야 하는 생성 횟수의 효율을 의미한다. 효율성이 높을수록 수천 번의 시도 대신 단 몇 번의 생성만으로도 정확한 정답에 도달할 수 있어 추론 비용을 절감한다.
- Pass@K
- — 모델이 K번의 독립적인 답변을 생성했을 때 그중 최소 하나가 정답일 확률을 나타내는 성능 평가 지표이다. 모델의 잠재적인 문제 해결 능력을 측정하는 데 주로 사용된다.
- 지식 증류(Distillation)
- — 거대 모델(Teacher)이 생성한 고품질의 추론 경로와 데이터를 작은 모델(Student)이 학습하게 하여 성능을 전이시키는 기법이다. 모델이 스스로 학습하는 RL과 달리 외부의 우수한 지식을 직접 주입하는 효과가 있다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2025. 12. 31.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.