기초 강화학습부터 DeepSeek R1의 GRPO까지 한 번에 끝내는 실전 커리큘럼
Research·Python0 / 0
고전적 강화학습 이론부터 LLM 정렬, DPO, GRPO 및 에이전트 시스템까지 아우르는 파이썬 기반 오픈소스 실전 교육 과정이다.
주요 기능
- PPO, DPO, GRPO 등 핵심 알고리즘의 라인별 코드 분석 제공
- CartPole부터 VLM 강화학습까지 단계별 실험 코드 포함
- 보상 해킹 및 KL 드리프트 등 실무적인 훈련 디버깅 가이드 수록
- VitePress 기반의 인터랙티브 학습 문서 및 시각화 지표 지원
- 도구 호출 및 다중 턴 상호작용을 포함한 에이전트 RL 프로젝트 구성
어떻게 동작하는가
파이토치를 사용하여 MDP 기반의 고전 강화학습을 구현하고, 이를 확장하여 LLM의 정책 최적화 및 그룹 상대 보상 메커니즘을 코드로 실체화한다.
1.5k
Stars
72
Forks
+369
Trending
0
조회수
1.5k watchers4 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.