Token-Level Feedback
토큰 수준 피드백
모델 출력 전체에 하나의 보상을 주는 대신 생성된 각 토큰의 적절성을 따로 평가하는 학습 신호다. 한 응답 안에서도 정상 작업에 기여한 토큰은 유지하고 공격 지시를 따른 토큰은 억제할 수 있다.
토큰 수준 피드백
모델 출력 전체에 하나의 보상을 주는 대신 생성된 각 토큰의 적절성을 따로 평가하는 학습 신호다. 한 응답 안에서도 정상 작업에 기여한 토큰은 유지하고 공격 지시를 따른 토큰은 억제할 수 있다.