walkinglabs/hands-on-modern-rl
Python0 / 0
고전적 강화학습 이론부터 LLM 정렬, DPO, GRPO 및 에이전트 시스템까지 아우르는 파이썬 기반 오픈소스 실전 교육 과정이다.
핵심 포인트
- PPO, DPO, GRPO 등 핵심 알고리즘의 라인별 코드 분석 제공
- CartPole부터 VLM 강화학습까지 단계별 실험 코드 포함
- 보상 해킹 및 KL 드리프트 등 실무적인 훈련 디버깅 가이드 수록
- VitePress 기반의 인터랙티브 학습 문서 및 시각화 지표 지원
1.5k
STARS
72
FORKS
+369
TRENDING
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.