본문으로 건너뛰기

Inductive Policy Optimization

귀납적 정책 최적화

여러 인과 슬라이스를 동일한 근원 모듈 기준으로 집계한 뒤 공통된 규칙·휴리스틱을 귀납적으로 생성하여 해당 모듈의 텍스트 지침에 주입하는 최적화 단계이다. STRACE는 사례별 수리 대신 일반화된 자연어 규칙을 root-cause 모듈의 프롬프트에 추가해 과적합 위험을 낮추고 안전한 지속적 개선을 도모했다. 이 방식은 코드 변경 없이 동작 정책을 수정할 수 있다는 점에서 비용 효율적이다.