용어 해설
- 검증 가능한 보상이 있는 강화학습(RLVR)
- — 수학 문제나 코드 실행 결과처럼 정답 여부를 명확히 확인할 수 있는 환경에서의 Reinforcement Learning임. 보상이 객관적이므로 모델의 추론 능력을 정밀하게 개선하는 데 필수적임.
- 에피스테믹 불확실성(Epistemic Uncertainty)
- — 모델이 특정 데이터를 충분히 학습하지 못해 발생하는 지식의 결여를 의미함. 데이터를 더 많이 관찰함으로써 줄일 수 있으며, 효율적인 학습을 위해 우선적으로 해소해야 할 대상임.
- 상호 정보량(Mutual Information)
- — 하나의 확률 변수를 관찰했을 때 다른 변수에 대해 얻게 되는 정보의 양을 측정함. 이 아티클에서는 보상을 관찰함으로써 모델의 성공률 예측이 얼마나 정확해지는지를 나타냄.
- 베타 분포(Beta Distribution)
- — 0과 1 사이의 값을 가지는 확률 변수의 분포를 모델링하는 데 사용됨. 성공과 실패 횟수를 바탕으로 모델의 현재 성공 확률을 추정하는 베이지안 업데이트에 최적화된 도구임.
- 알레아토리 불확실성(Aleatoric Uncertainty)
- — 데이터 자체의 난이도나 노이즈로 인해 발생하는 근본적인 무작위성을 의미함. 학습을 더 한다고 해서 줄어들지 않으며, 난이도 조절의 핵심 요소가 됨.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.