본문으로 건너뛰기

reward-backpropagation

Reward Backpropagation

중급

보상 신호의 그래디언트를 샘플링 경로를 따라 역전파하는 기법으로, 샘플링과 최적화를 연결하는 역할을 한다.