용어 해설
- 검증 가능한 보상을 통한 강화학습(RLVR)
- — 수학 문제나 코드 생성처럼 정답 여부를 객관적으로 검증할 수 있는 환경에서 수행하는 강화학습 기법이다. 모델이 생성한 결과물의 정답 여부를 보상 신호로 사용하여 추론 능력을 고도화하는 데 핵심적인 역할을 한다.
- 오프-폴리시(Off-policy)
- — 현재 학습 중인 정책이 아닌, 과거의 정책이나 외부 모델 등 다른 소스에서 생성된 데이터를 학습에 사용하는 방식이다. 탐색의 범위를 넓히고 학습 효율을 높일 수 있지만, 현재 정책과의 분포 차이로 인해 학습 불안정성을 초래할 수 있다.
- 중요도 가중치(Importance Weighting)
- — 서로 다른 분포에서 수집된 데이터를 학습할 때 발생하는 편향을 보정하기 위해 각 샘플에 부여하는 가중치다. 현재 정책과 데이터 생성 정책 간의 확률 비율을 계산하여 업데이트 크기를 조절함으로써 오프-폴리시 학습의 안정성을 확보한다.
- 엔트로피 붕괴(Entropy Collapse)
- — 강화학습 과정에서 모델이 특정 답변 패턴에만 고착되어 출력의 다양성이 급격히 감소하는 현상이다. 이는 새로운 해결책을 찾는 탐색 능력을 저하시켜 성능 개선이 정체되는 플래토(Plateau) 현상의 주요 원인이 된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.