회고적 학습(힌드시트)
회고적 학습은 완료된 에피소드의 전체 궤적을 바탕으로 성공·실패 원인과 재사용 가능한 전략을 추출하여 원래의 행동 결정 시점에는 없던 정보로 학습 신호를 생성하는 기법이다. 본문에서는 완료된 궤적에서 자연어 스킬을 생성해 토큰 수준의 보조 손실로 변환함으로써 희소한 최종 보상으로는 잡기 어려운 중간 결정의 기여도를 보상한다. 회고적 지식이 정책과 동기화되면 정책이 발전함에 따라 스킬도 함께 진화한다는 점이 핵심이다.