용어 해설
- 검증 가능한 보상을 통한 강화 학습(RLVR)
- — 수학 문제의 정답이나 코드의 실행 결과처럼 자동 검증이 가능한 보상 신호를 활용해 LLM을 학습시키는 강화 학습 기법이다. 모델이 생성한 결과물의 정오답을 명확히 판별할 수 있어 고도의 추론 능력을 갖춘 모델을 만드는 데 핵심적인 역할을 한다.
- 온폴리시 최적화(On-policy Optimization)
- — 모델이 현재 가지고 있는 정책(Policy)에 따라 직접 생성한 데이터를 즉시 학습에 사용하는 방식이다. 데이터의 신선도가 높지만, 매 업데이트마다 새로운 데이터를 대량으로 샘플링해야 하므로 계산 비용이 매우 높다는 단점이 있다.
- 중요도 샘플링(Importance Sampling)
- — 서로 다른 확률 분포에서 수집된 데이터를 학습에 사용할 때, 두 분포의 차이만큼 가중치를 조절하여 기댓값을 보정하는 통계적 기법이다. 강화 학습에서는 과거의 정책이나 다른 모델이 생성한 데이터를 현재 모델의 학습에 활용하기 위해 필수적으로 사용된다.
- 어드밴티지 추정(Advantage Estimation)
- — 특정 행동이 평균적인 행동보다 얼마나 더 좋은지를 수치화하는 과정이다. 보상 값에서 기준점(Baseline)을 빼서 계산하며, 모델이 어떤 방향으로 정책을 업데이트해야 보상을 극대화할 수 있을지 결정하는 지표가 된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.