본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
LLM 수학적 추론에서의 접근 수준 다양성
언어 피드백을 활용한 Variational Policy Distillation
RLVR을 이용한 문법 유도 및 고유 정보 강화 학습(RLEI) 제안
Multilingual Reasoning Gym: 절차적 추론 환경의 다국어 확장
강화학습 훈련을 방해하는 모델의 전략적 행동: 탐색 해킹 프레임워크
2025년 LLM 현황 보고서: 발전, 문제점 그리고 미래 예측
LLM의 강화학습(RLVR)은 정말로 새로운 추론 능력을 만들어내는가?
LLM의 추론 능력: RLVR은 정말 새로운 능력을 만드는가?
OpenAI RFT API와 RLVR을 활용한 LLM 파인튜닝 실전 가이드
다중 모달 언어 모델 향상: 시각적 편향 제거 평가를 통한 단계적 포스트 트레이닝
무작위로 선택된 Few-shot 지시를 통한 검증 가능한 보상으로 강화학습 성능 향상
실패로부터 학습하기: Verifiable Rewards를 활용한 Correction-Oriented Policy Optimization(CIPO)
Rebellious Student: RLRT—RLVR에서 교사 신호를 역방향으로 읽어 추론 탐색을 강화하는 Self-Distilled RLVR
Near-Future Policy Optimization: 미래의 자신으로부터 배우는 강화학습
DSDR: LLM 추론 탐색을 위한 이중 스케일 다양성 정규화
Self-Distilled RLVR: 강화학습과 자기 증류를 결합한 안정적인 LLM 학습 프레임워크
Apriel-Reasoner: 범용적이고 효율적인 추론을 위한 강화학습 사후 학습
LLM 추론을 위한 RLVR 업데이트 방향에 대하여: 식별 및 활용
HopChain: 일반화 가능한 시각-언어 추론을 위한 멀티홉 데이터 합성
길이 확장을 넘어: 생성형 보상 모델을 위한 너비와 깊이의 시너지
← 피드로 돌아가기
RLVR
Training (학습/파인튜닝)
약 31개 아티클
관련 태그:
GRPO
Qwen3
DeepSeek-R1
Apple
OpenAI
Qwen
Chain of Thought
Pass@K
CoT
RL