rl-as-data-generator
데이터 생성 수단으로서의 강화학습
환경(자연)을 검증자로 삼아 에이전트가 실험을 설계·시행하고 보상 신호 대신 실험적 검증을 통해 유효성을 확보하는 방식으로, 강화학습을 모델 성능 개선 목적이 아닌 대규모 실험 데이터·행동 궤적 생성 메커니즘으로 활용하는 접근을 말한다.
데이터 생성 수단으로서의 강화학습
환경(자연)을 검증자로 삼아 에이전트가 실험을 설계·시행하고 보상 신호 대신 실험적 검증을 통해 유효성을 확보하는 방식으로, 강화학습을 모델 성능 개선 목적이 아닌 대규모 실험 데이터·행동 궤적 생성 메커니즘으로 활용하는 접근을 말한다.