본문으로 건너뛰기

rlft

강화학습 기반 추론 학습

중급

추론 능력을 강화하기 위한 강화학습 기법이다. 모델의 추론 과정을 보상으로 학습시켜 논리적 사고와 문제 해결 능력을 개선한다.