일상적인 대화 피드백을 학습 신호로 변환하는 비동기 강화학습 엔진
LLM Framework·TypeScript0 / 0
사용자와의 실시간 대화와 자연어 피드백을 활용해 로컬 AI 모델을 서비스 중단 없이 지속적으로 최적화하는 완전 비동기 강화학습 프레임워크이다.
주요 기능
- 에이전트 서빙, 롤아웃 수집, PRM 평가, 정책 학습을 독립적으로 수행하는 4개 구성 요소 비동기 아키텍처를 구현했다.
- 사용자의 좋아요/싫어요와 같은 암시적 피드백을 GRPO 알고리즘의 보상 신호로 자동 변환하여 학습에 반영한다.
- 자연어 교정 피드백에서 핵심 힌트를 추출하여 토큰 수준의 방향성 신호로 모델을 교정하는 온폴리시 증류(OPD)를 지원한다.
- SGLang 기반의 고성능 추론 엔진을 통합하여 대규모 환경 병렬화와 실시간 가중치 업데이트를 수행한다.
- 세션 기반 학습 관리 기능을 통해 다회차 대화의 문맥을 유지하며 학습 샘플의 순서와 품질을 보장한다.
사용 사례
- 사용자의 특정 업무 스타일이나 선호도를 실시간 대화 피드백으로 학습하여 맞춤형 로컬 비서를 구축하는 경우
- 터미널 조작이나 코드 작성 등 실제 환경의 실행 결과 피드백을 기반으로 자율 에이전트의 성능을 지속적으로 개선하는 환경
1.7k
Stars
161
Forks
+663
Trending
0
조회수
1.7k watchers15 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.