Self-Calibrating Training Signal
자기조정형 훈련 신호
정적 난이도 스케줄 없이 모델의 현재 능력에 따라 자동으로 판별력이 유지되는 보상 신호를 생성하는 메커니즘으로, 프롬프트 난이도를 정책 성능에 맞춰 점증적으로 조정하여 보상 신호의 정보량을 유지한다.
자기조정형 훈련 신호
정적 난이도 스케줄 없이 모델의 현재 능력에 따라 자동으로 판별력이 유지되는 보상 신호를 생성하는 메커니즘으로, 프롬프트 난이도를 정책 성능에 맞춰 점증적으로 조정하여 보상 신호의 정보량을 유지한다.