본문으로 건너뛰기

Self-rewarding RL

자기 보상 강화학습

모델이 자신의 여러 응답, 확률 분포, 자기 일관성 등을 이용해 보상을 직접 만드는 강화학습 방식이다. 모델의 판단만 반복해서 사용하기 때문에 기존 편향과 오류가 강화되고 응답이 획일화될 위험이 있다.