본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
TurnOPD: 장기간 에이전트의 효율적 온-정책 증류를 위한 턴 단위 예산 전략
Qwen-Image-2.0-RL 기술 보고서
V-Zero: 대조적 증거 게이팅을 이용한 답 라벨 없는 온-폴리시 증류로 세부 시각 추론 향상
언어 피드백을 활용한 Variational Policy Distillation
LLM Reasoning에서 Self-Distillation을 위한 Adaptive Teacher Exposure
대형 언어 모델을 위한 온폴리시 증류(On-Policy Distillation) 서베이
← 피드로 돌아가기
On-Policy Distillation
Training (학습/파인튜닝)
약 6개 아티클
관련 태그:
ALFWorld
ATESD
Beta-policy controller
f-divergence
GRPO
Knowledge Distillation
Qwen-Image-2.0
RLVR
TurnOPD
Variational Policy Distillation