자기조정형 훈련 신호
정적 난이도 스케줄 없이 모델의 현재 능력에 따라 자동으로 판별력이 유지되는 보상 신호를 생성하는 메커니즘으로, 프롬프트 난이도를 정책 성능에 맞춰 점증적으로 조정하여 보상 신호의 정보량을 유지한다.