본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

walkinglabs/hands-on-modern-rl

Python0 / 0

고전적 강화학습 이론부터 LLM 정렬, DPO, GRPO 및 에이전트 시스템까지 아우르는 파이썬 기반 오픈소스 실전 교육 과정이다.

핵심 포인트

  • PPO, DPO, GRPO 등 핵심 알고리즘의 라인별 코드 분석 제공
  • CartPole부터 VLM 강화학습까지 단계별 실험 코드 포함
  • 보상 해킹 및 KL 드리프트 등 실무적인 훈련 디버깅 가이드 수록
  • VitePress 기반의 인터랙티브 학습 문서 및 시각화 지표 지원

1.5k

STARS

72

FORKS

+369

TRENDING

0

조회수

watchers 1.5kopen issues 4Other

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.