오픈루프 최적화
오픈루프 최적화는 업데이트 이후의 정책 성능을 명시적으로 검증하지 않고 순차적으로 배치를 처리하는 훈련 패턴을 가리킨다. 본문은 PPO, GRPO, DAPO 등 여러 사후훈련 기법이 대체로 오픈루프 방식으로 동작하며 샘플링 잡음·불완전한 크레디트 어사인먼트로 인해 학습이 불안정해질 수 있음을 지적한다. PIPO는 오픈루프의 문제를 보완하기 위해 업데이트 결과를 회고적으로 평가하는 닫힌 루프를 추가한다.