학습 신호
학습 신호는 모델 가중치를 갱신하는 데 사용되는 보상·손실 정보로, 원문 맥락에서는 검증 방식이 학습 신호의 품질을 직접 결정해 과도한 규격화가 신호를 얕게 만든다는 문제가 핵심으로 제기된다.