본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
LongStraw: 고정 GPU 예산으로 백만 토큰급 RL 포스트트레이닝을 실행하는 아키텍처 인식 스택
Flexibility Trap의 ICML 우수상 수상과 JustGRPO 튜토리얼 재현기
VaseMuseum: 고대 그리스 도기용 지능형 디지털 박물관
Amazon Nova Forge 기반 SageMaker HyperPod 다중 회차 RL 훈련 파이프라인 아키텍처
Unbounded Positive Asymmetric Optimization(UP): 중요도 샘플링 기반 RL의 탐색-안정성 딜레마 해소
에이전트형 강화학습을 위한 단일 롤아웃 비동기 최적화
한 층만 훈련해도 충분한가: 단일 Transformer 층 학습으로 전체 파라미터 RL 훈련과 동등하거나 더 나은 성능 달성
TREK: 검증된 제안으로 탐색 지지 확장하고 GRPO로 정제하는 학습 절차
CanvasAgent: 시각 도구 오케스트레이션을 통한 복합 이미지 생성 및 편집
Mastermind: 전략 수준 학습으로 리포지토리 규모 취약점 재현을 개선한 연구
지속적 사후 학습에서 온-폴리시 자기증류 정책 최적화(SDPO)의 한계
일반적 추론을 위한 전이성 인식 커리큘럼: 다중 도메인 RLVR의 자동화된 샘플링 전략
실패 연쇄 해소: 단계 인지 강화학습을 통한 의료 멀티모달 추론
GRPO, Dr. GRPO 및 DAPO는 하나의 수에 대한 세 연산: 그룹 표준편차 항등식
TRIAGE: 에이전트형 강화학습을 위한 역할 유형별 크레딧 할당
Qwen-Image-2.0-RL 기술 보고서
신뢰도 인식 도구 오케스트레이션을 통한 강건한 비디오 이해
RL-Index: Retrieval Index Reasoning을 위한 Reinforcement Learning
RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents
ECHO: 터미널 에이전트가 비용 없이 월드 모델을 학습한다
← 피드로 돌아가기
GRPO
Training (학습/파인튜닝)
약 152개 아티클
관련 태그:
Qwen2.5
Qwen3
Qwen
DeepSeek-R1
PPO
RLHF
RLVR
vLLM
RL
Qwen3-VL