offline-reinforcement-learning
오프라인 강화학습
실시간 환경과 상호작용하지 않고 이미 수집된 데이터와 보상 신호만으로 정책을 학습하는 방식입니다. 이 글에서는 미리 생성된 설명 후보와 BERTScore-F1 라벨을 이용해 선택 정책을 학습하는 설정을 가리킵니다.
오프라인 강화학습
실시간 환경과 상호작용하지 않고 이미 수집된 데이터와 보상 신호만으로 정책을 학습하는 방식입니다. 이 글에서는 미리 생성된 설명 후보와 BERTScore-F1 라벨을 이용해 선택 정책을 학습하는 설정을 가리킵니다.