reward-worker
보상 평가 작업자
강화학습 과정에서 모델의 결과를 평가해 보상 신호를 제공하는 구성 요소다. 이 글에서는 Kimi K2.6이 편집 결과를 평가하는 reward worker로 사용되어 Prompt Extend 모델의 학습 방향을 결정한다.
보상 평가 작업자
강화학습 과정에서 모델의 결과를 평가해 보상 신호를 제공하는 구성 요소다. 이 글에서는 Kimi K2.6이 편집 결과를 평가하는 reward worker로 사용되어 Prompt Extend 모델의 학습 방향을 결정한다.