관련 기사 바로가기
Self-OPD: 교사 모델 없는 흐름 매칭 모델을 위한 온폴리시 증류 프레임워크.TurnOPD: 장기간 에이전트의 효율적 온-정책 증류를 위한 턴 단위 예산 전략Qwen-Image-2.0-RL 기술 보고서V-Zero: 대조적 증거 게이팅을 이용한 답 라벨 없는 온-폴리시 증류로 세부 시각 추론 향상언어 피드백을 활용한 Variational Policy DistillationLLM Reasoning에서 Self-Distillation을 위한 Adaptive Teacher Exposure대형 언어 모델을 위한 온폴리시 증류(On-Policy Distillation) 서베이
← 피드로 돌아가기
On-policy distillation
약 7개 아티클
관심 태그 추가
관련 태그:ALFWorldATESDBeta-policy controllerf-divergenceflow matchingGRPOKnowledge DistillationQwen-Image-2.0RLVRSelf-OPD
TIMEHEADLINE