resampling-forcing
재샘플링 포싱
재샘플링 포싱은 학습 중에 모델 자체가 생성한 과거 출력을 history로 대체하여 추론 시 분포와 유사한 조건에서 훈련하게 만드는 기법이다. 각 과거 청크를 단일 단계로 재생성한 뒤 그래디언트 전파를 차단하며 온-폴리시(history) 분포를 노출한다. 이 방식은 train–inference 불일치로 인한 장기 누적 오류를 완화하는 목적을 가진다.
재샘플링 포싱
재샘플링 포싱은 학습 중에 모델 자체가 생성한 과거 출력을 history로 대체하여 추론 시 분포와 유사한 조건에서 훈련하게 만드는 기법이다. 각 과거 청크를 단일 단계로 재생성한 뒤 그래디언트 전파를 차단하며 온-폴리시(history) 분포를 노출한다. 이 방식은 train–inference 불일치로 인한 장기 누적 오류를 완화하는 목적을 가진다.