TL;DR
REPO(Relative Entropy Policy Optimization)는 온폴리시와 오프폴리시 강화학습의 장점을 결합하여 대규모 리플레이 버퍼 없이도 안정적인 가치 함수 학습을 가능하게 하는 알고리즘입니다. TD Lambda 타겟, 신뢰 영역, 엔트로피 정규화를 통합하여 기존 제로차수 정책 경사 알고리즘인 REINFORCE나 PPO의 고질적인 문제인 높은 분산과 불안정성을 해결합니다. MuJoCo 및 병렬화된 로봇 조작 작업 벤치마크에서 REPO는 PPO 대비 더 안정적인 학습 성능과 높은 신뢰도를 보여주며, 특히 학습 후반부의 성능 저하 없이 안정적인 수렴을 보장합니다.
챕터별 상세
Talk Setup and Goal
Two Actor Critic Paradigms
액터-크리틱은 정책을 학습하는 액터와 가치를 평가하는 크리틱을 동시에 학습시키는 구조입니다.
Reinforce and Advantage Basics
Pathwise Gradients and Critics
경로 방식은 정책의 미분 가능성을 활용하여 더 효율적인 업데이트를 가능하게 합니다.
When PPO Beats Value Methods
Toy Example Variance vs Bias
Why Resampling Matters
PPO Straight Line Updates
Building REPO Ingredients
TD Lambda Targets Explained
TD Lambda는 시간차 학습에서 여러 단계의 보상을 결합하여 가치를 추정하는 방식입니다.
Trust Regions and Auto Tuning
Results and Key Takeaways
Benchmarks Beyond DM Control
Q and A Discussion
Wrap Up and Thanks
용어 해설
- Actor-Critic
- — 액터(Actor)가 정책을 학습하고 크리틱(Critic)이 가치 함수를 추정하여 정책을 평가하는 강화학습 아키텍처입니다. 액터는 크리틱의 피드백을 통해 더 나은 행동을 선택하도록 학습하며, REPO와 같은 알고리즘의 핵심 기반이 됩니다.
- Policy Gradient
- — 기대 보상을 최대화하기 위해 정책 파라미터를 직접 업데이트하는 최적화 방법입니다. 보상 함수의 경사를 따라 정책을 수정하며, REINFORCE나 PPO 등 다양한 강화학습 알고리즘의 근간이 됩니다.
- Reparameterization Trick
- — 확률적 노드를 미분 가능하게 만들기 위해 샘플을 파라미터와 노이즈의 결정론적 함수로 표현하는 기법입니다. 이를 통해 경사 하강법을 적용할 수 있게 하여 학습 효율을 높입니다.
- Trust Region
- — 정책 업데이트가 신뢰할 수 있는 범위 내에서만 이루어지도록 제약을 거는 최적화 기법입니다. 급격한 정책 변화를 방지하여 학습의 안정성을 확보합니다.
- Entropy Regularization
- — 정책의 엔트로피를 목적 함수에 추가하여 에이전트가 너무 빨리 결정론적 정책으로 수렴하지 않고 탐색을 지속하도록 장려하는 기법입니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
