전략 수준 강화학습
전략 수준 강화학습은 긴 실행 궤적 대신 재사용 가능한 자연어 전략을 정책의 출력 단위로 삼아 보상 신호로부터 정책을 갱신하는 접근이다. 본 논문 맥락에서는 긴 리포지토리 실행(trace) 대신 최대 2,000토큰의 전략 텍스트를 생성하여 실행 비용을 크게 낮추고 전달 가능한 패턴을 학습하는 데 중요했다.