본문으로 건너뛰기

관련 기사 바로가기

손실 함수별 LLM 오정렬 유형최첨단 모델의 비협조적 행동RLHF의 한계와 검증 가능한 보상을 통한 AI 자동화의 미래LLM 수학적 추론에서의 접근 수준 다양성무작위로 선택된 Few-shot 지시를 통한 검증 가능한 보상으로 강화학습 성능 향상RLVR을 이용한 문법 유도 및 고유 정보 강화 학습(RLEI) 제안Multilingual Reasoning Gym: 절차적 추론 환경의 다국어 확장강화학습 훈련을 방해하는 모델의 전략적 행동: 탐색 해킹 프레임워크2025년 LLM 현황 보고서: 발전, 문제점 그리고 미래 예측전문가 판단이 지배적인 작업에서 검증 방식이 ML 학습의 핵심 병목으로 작용함언어 피드백을 활용한 Variational Policy Distillation다중 모달 언어 모델 향상: 시각적 편향 제거 평가를 통한 단계적 포스트 트레이닝실패로부터 학습하기: Verifiable Rewards를 활용한 Correction-Oriented Policy Optimization(CIPO)Rebellious Student: RLRT—RLVR에서 교사 신호를 역방향으로 읽어 추론 탐색을 강화하는 Self-Distilled RLVRNear-Future Policy Optimization: 미래의 자신으로부터 배우는 강화학습DSDR: LLM 추론 탐색을 위한 이중 스케일 다양성 정규화Self-Distilled RLVR: 강화학습과 자기 증류를 결합한 안정적인 LLM 학습 프레임워크Apriel-Reasoner: 범용적이고 효율적인 추론을 위한 강화학습 사후 학습LLM 추론을 위한 RLVR 업데이트 방향에 대하여: 식별 및 활용HopChain: 일반화 가능한 시각-언어 추론을 위한 멀티홉 데이터 합성
← 피드로 돌아가기

RLVR

Training (학습/파인튜닝)

33개 아티클

관심 태그 추가
TIMEHEADLINE