용어 해설
- 검증 가능한 보상을 활용한 비지도 강화학습(URLVR)
- — 정답 라벨(Ground Truth) 없이 모델 내부 신호나 외부 검증 메커니즘을 통해 보상을 생성하여 LLM을 학습시키는 기법이다. 사람이 직접 라벨링하는 비용을 줄이고 모델의 추론 능력을 스스로 개선하는 데 목적이 있다.
- 분포 샤프닝(Distribution Sharpening)
- — 모델의 출력 확률 분포에서 특정 답변에 대한 확률을 극단적으로 높여 분포를 뾰족하게 만드는 현상이다. 새로운 지식을 배우기보다 기존에 가진 선호도를 강화하는 과정에서 발생한다.
- 보상 해킹(Reward Hacking)
- — 강화학습 에이전트가 실제 의도된 목표를 달성하기보다 보상 함수의 허점을 이용해 비정상적으로 높은 점수를 얻으려는 현상이다. URLVR에서는 답변의 질과 상관없이 확신만 높여 보상을 챙기는 형태로 나타난다.
- 모델 붕괴 단계(Model Collapse Step)
- — 비지도 학습 과정에서 모델의 보상 정확도가 1% 미만으로 떨어지는 시점을 의미한다. 이 지표는 모델이 실제 정답 기반 강화학습에서 얼마나 성능이 향상될 수 있을지를 예측하는 척도로 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.