밀집 피드백
최종 성공 여부만 주는 대신 작업 과정의 여러 단계에 연속적인 학습 신호를 부여하는 방식입니다. 이 연구에서는 강화학습의 샘플 효율과 에이전트 진행률 추정에 활용합니다.