본문으로 건너뛰기

관련 기사 바로가기

한 층만 훈련해도 충분한가: 단일 Transformer 층 학습으로 전체 파라미터 RL 훈련과 동등하거나 더 나은 성능 달성TREK: 검증된 제안으로 탐색 지지 확장하고 GRPO로 정제하는 학습 절차CanvasAgent: 시각 도구 오케스트레이션을 통한 복합 이미지 생성 및 편집Mastermind: 전략 수준 학습으로 리포지토리 규모 취약점 재현을 개선한 연구Amazon Nova Forge 기반 SageMaker HyperPod 다중 회차 RL 훈련 파이프라인 아키텍처지속적 사후 학습에서 온-폴리시 자기증류 정책 최적화(SDPO)의 한계일반적 추론을 위한 전이성 인식 커리큘럼: 다중 도메인 RLVR의 자동화된 샘플링 전략실패 연쇄 해소: 단계 인지 강화학습을 통한 의료 멀티모달 추론GRPO, Dr. GRPO 및 DAPO는 하나의 수에 대한 세 연산: 그룹 표준편차 항등식TRIAGE: 에이전트형 강화학습을 위한 역할 유형별 크레딧 할당Qwen-Image-2.0-RL 기술 보고서신뢰도 인식 도구 오케스트레이션을 통한 강건한 비디오 이해RL-Index: Retrieval Index Reasoning을 위한 Reinforcement LearningRODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use AgentsECHO: 터미널 에이전트가 비용 없이 월드 모델을 학습한다다이나믹 분산 적응 이점 최적화(DVAO): 다중 보상 강화학습을 위한 동적 가중치 조정시각적 지속 학습에서 재앙적 망각을 극복하기 위한 Reinforcement Fine-Tuning모든 루브릭이 똑같이 가르치지는 않는다: RLVR를 위한 정책 인식 루브릭 보상 POW3R안락한 영역을 벗어나게 하는 넛지: RLVR를 위한 전략 주도형 탐색의 효율화AlphaGRPO: Decompositional Verifiable Reward를 통한 UMM에서 자가 반영형 다중모달 생성 강화
← 피드로 돌아가기

GRPO

Training (학습/파인튜닝)

160개 아티클

관심 태그 추가
TIMEHEADLINE