관련 기사 바로가기
CoGR: 검색 매칭을 함께 진화시키는 두 LLMPaperGym: 연구 논문을 계획 생성 학습 환경으로 전환RL verifier의 보상 해킹을 잡는 ratctlAmazon Nova Forge의 다중 턴 강화 학습 보상 설계Sidekick의 지속 학습 플라이휠기업 환경에서 실시간으로 학습하는 강화학습 모델 구축 전략.Flexibility Trap의 ICML 우수상 수상과 JustGRPO 튜토리얼 재현기주석을 정답 rollout으로 쓰는 비디오 강화학습세 LLM에서 GRPO 후 성능 저하와 KV cache 검증강화학습으로 멀티모달 에이전트의 자기 검증 유도온폴리시 자기 증류를 통한 AI 모델의 지속적 학습 및 성능 개선다수결로 정답을 만드는 비지도 Self-DistillationAgentOPSD: 로그오즈 기반 재귀적 자기증류로 턴 신용 복원Video-DeepResearch 멀티모달 딥리서치 에이전트CoRT: 토큰 수준 루브릭 신용 재분배IQA-T1: 증거 기반 도구 호출로 해석 가능한 이미지 품질 평가 모델LongStraw: 고정 GPU 예산으로 백만 토큰급 RL 포스트트레이닝을 실행하는 아키텍처 인식 스택VaseMuseum: 고대 그리스 도기용 지능형 디지털 박물관Unbounded Positive Asymmetric Optimization(UP): 중요도 샘플링 기반 RL의 탐색-안정성 딜레마 해소에이전트형 강화학습을 위한 단일 롤아웃 비동기 최적화