Gen-Verse/OpenClaw-RL
TypeScript1 / 0
사용자와의 실시간 대화와 자연어 피드백을 활용해 로컬 AI 모델을 서비스 중단 없이 지속적으로 최적화하는 완전 비동기 강화학습 프레임워크이다.
핵심 포인트
- 에이전트 서빙, 롤아웃 수집, PRM 평가, 정책 학습을 독립적으로 수행하는 4개 구성 요소 비동기 아키텍처를 구현했다.
- 사용자의 좋아요/싫어요와 같은 암시적 피드백을 GRPO 알고리즘의 보상 신호로 자동 변환하여 학습에 반영한다.
- 자연어 교정 피드백에서 핵심 힌트를 추출하여 토큰 수준의 방향성 신호로 모델을 교정하는 온폴리시 증류(OPD)를 지원한다.
- SGLang 기반의 고성능 추론 엔진을 통합하여 대규모 환경 병렬화와 실시간 가중치 업데이트를 수행한다.
1.7k
STARS
161
FORKS
+663
TRENDING
1
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.