용어 해설
- 그룹 상대 정책 최적화(GRPO)
- — 별도의 가치 함수 네트워크 없이 동일한 작업에 대해 여러 번의 시도를 수행하고, 그 결과들의 상대적 보상 차이를 이용해 정책을 업데이트하는 강화학습 기법이다. PPO 대비 연산 자원을 절약하면서도 안정적인 학습이 가능해 대형 언어 모델 정렬에 자주 사용된다.
- 온 정책 학습(On-policy Learning)
- — 현재 학습 중인 에이전트가 직접 환경과 상호작용하며 얻은 데이터를 즉시 학습에 사용하는 방식이다. 데이터의 분포가 현재 정책과 일치하여 학습이 안정적이지만, 이미 알고 있는 영역만 반복해서 탐색할 위험이 있다.
- 오프 정책 학습(Off-policy Learning)
- — 과거의 정책이나 다른 에이전트가 생성한 데이터를 학습에 활용하는 방식이다. 데이터 효율성이 높고 다양한 경험을 학습할 수 있지만, 현재 정책과의 분포 차이로 인해 학습 과정이 불안정해질 수 있다.
- 내재적 보상(Intrinsic Reward)
- — 환경에서 주어지는 최종 성공 보상 외에 에이전트가 스스로 새로운 상태를 발견하거나 참신한 행동을 했을 때 부여하는 보상이다. 외부 보상이 드문 복잡한 환경에서 에이전트가 지치지 않고 탐색을 지속하게 만드는 원동력이 된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.