관련 기사 바로가기
Crosslingual On-Policy Self-Distillation for Multilingual Reasoning시각적 열화에 대응한 멀티모달 추론 강화의미 없는 텍스트의 도움: 프롬프트 공간 섭동을 통한 추론 탐색 확장StraTA: 전략적 궤적 추상화를 통한 에이전트 강화학습 촉진SageMaker AI에서 GRPO를 활용한 검증 가능한 보상 기반 강화학습 구현하기Skills-Coach: 학습이 필요 없는 GRPO를 통한 자기 진화형 기술 최적화 도구V-GRPO: 노이즈 제거 생성 모델을 위한 온라인 강화학습은 생각보다 쉽다GRPO를 활용한 소형 LLM의 64토큰 요약 성능 최적화 실험Near-Future Policy Optimization: 미래의 자신으로부터 배우는 강화학습효율적인 시각적 추론을 위한 적응형 추론 경로 학습LeapAlign: 2단계 궤적 구축을 통한 모든 생성 단계에서의 사후 학습 플로우 매칭 모델 정렬MLX와 GRPO를 활용한 Mac Mini 클러스터 기반 요약 모델 강화학습 실험Qwen2.5-0.5B 모델을 활용한 GRPO 기반 Reddit 게시물 요약 학습 실험Faithful GRPO: 제약 조건 정책 최적화를 통한 멀티모달 언어 모델의 시각적 공간 추론 능력 향상CLEAR: 통합 멀티모달 모델에서 품질 저하 이미지 이해를 위한 생성 잠재력 해제MinerU2.5-Pro: 데이터 중심 설계를 통한 대규모 문서 파싱의 한계 돌파샘플 라우팅을 통한 그룹 상대적 정책 최적화와 자기 증류 정책 최적화의 통합PyVision-RL: 강화학습을 통한 개방형 에이전트 시각 모델 구축DSDR: LLM 추론 탐색을 위한 이중 스케일 다양성 정규화VectorGym: SVG 코드 생성, 스케치 및 편집을 위한 멀티태스크 벤치마크