본문으로 건너뛰기
관련 기사 바로가기
PaperGym: 연구 논문을 계획 생성 학습 환경으로 전환
레이블 없이 테스트 타임에 학습하는 TTPO: 비대칭 목적 함수를 통한 LLM 성능 최적화
온-폴리시 자기 증류(On-Policy Self-Distillation) 연구 및 최신 동향 분석.
AgentOPSD: 로그오즈 기반 재귀적 자기증류로 턴 신용 복원
이중 앵커 정책 증류 (DAPD)
Self-Distilled RLVR: 강화학습과 자기 증류를 결합한 안정적인 LLM 학습 프레임워크
← 피드로 돌아가기
OPSD
Training (학습/파인튜닝)
약 6개 아티클
관심 태그 추가
Training
관련 태그:
Qwen3
GRPO
PaperGym
RL
RLSD
RLVR
Self-Distillation
AgentOPSD
TTPO
DAPD
TIME
HEADLINE
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필