Self-rewarding RL
자기 보상 강화학습
모델이 자신의 여러 응답, 확률 분포, 자기 일관성 등을 이용해 보상을 직접 만드는 강화학습 방식이다. 모델의 판단만 반복해서 사용하기 때문에 기존 편향과 오류가 강화되고 응답이 획일화될 위험이 있다.
자기 보상 강화학습
모델이 자신의 여러 응답, 확률 분포, 자기 일관성 등을 이용해 보상을 직접 만드는 강화학습 방식이다. 모델의 판단만 반복해서 사용하기 때문에 기존 편향과 오류가 강화되고 응답이 획일화될 위험이 있다.