본문으로 건너뛰기
Grouped RL
Grouped RL
여러 샘플 그룹을 비교하여 강화학습을 수행하는 방식이다. 샘플 간의 불일치를 보상 신호로 활용하여 모델의 오류를 교정한다.
비슷한 개념
group-based-rl
Group Relative Policy Optimization
Reinforcement Learning with Verifiable Rewards
Reward Model Training
GRPO (group-relative policy optimization)
Group-Relative Advantage
Multimodal Reinforcement Learning
RLFT
← 용어 사전 전체 보기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필