본문으로 건너뛰기

Self-Calibrating Training Signal

자기조정형 훈련 신호

정적 난이도 스케줄 없이 모델의 현재 능력에 따라 자동으로 판별력이 유지되는 보상 신호를 생성하는 메커니즘으로, 프롬프트 난이도를 정책 성능에 맞춰 점증적으로 조정하여 보상 신호의 정보량을 유지한다.