본문으로 건너뛰기
HF Daily Papers조회 2

MOPD: LLM 포스트트레이닝에서 능력 통합을 위한 다중 교사 온-폴리시 증류

여러 도메인에 특화된 RL 교사들을 하나의 모델로 통합하는 작업은 실무에서 빈번하게 필요하지만 기존 방식들은 효율성과 안정성 간의 트레이드오프를 보였다. MOPD는 학생의 자체 롤아웃에서 도메인별 교사가 토큰 수준의 확률 신호를 제공하는 방식으로 통합을 수행해 노출 바이어스를 제거했다. 이로 인해 도메인별 개발을 병렬화할 수 있고 산업 규모 모델인 MiMo-V2-Flash에 적용해 실무적 가치가 확인되었다.

용어 해설

온-폴리시 증류(On-Policy Distillation)
학생 모델의 자체 롤아웃에서 생성된 토큰 경로를 이용해 교사의 토큰 확률분포로 학생을 맞추는 방법이다. 학생이 실제 추론 분포 상에서 학습하므로 노출 바이어스가 제거되고 토큰 수준의 촘촘한 신호가 제공된다. MOPD는 이를 여러 도메인 교사로 확장해 도메인별 라우팅을 적용한다.
노출 바이어스(Exposure Bias)
오프폴리시 학습에서 발생하는 분포 불일치 문제로, 학습 시 사용한 교사 롤아웃과 학생의 추론 시 상태 분포가 달라 성능 저하가 발생한다. 학생이 교사 분포에만 적응하면 실제 추론에서 잘못된 토큰을 만나 오류가 누적된다. MOPD는 학생의 자체 롤아웃에서 학습해 이 문제를 구조적으로 제거한다.
역 KL(Reverse KL)
학생 분포 π_theta를 기준으로 π_theta log(π_theta/π_phi) 형태로 측정하는 KL로, 학생이 교사 분포에 수렴하도록 확률 분포 전체를 조정하는 목적함수이다. 토큰 수준으로 적용하면 각 시점에서 학생이 교사 확률을 따라가도록 밀도 차이를 줄인다. MOPD는 이 값을 평균해 per-token 손실로 최적화한다.
Top-K 증류(Top-K Distillation)
교사의 전체 어휘 분포 대신 상위 k개의 토큰만 고려해 학생을 갱신하는 방법이다. 전송할 로그 확률·로짓의 양을 줄여 인프라 비용을 낮추는 한편, 잘라내기 편향을 보정하는 항을 추가해 수렴점의 일관성을 유지한다. MOPD는 k=64 등 실무적 설정으로 비교 실험을 수행했다.
교사 프리필(Teacher Prefill)
학생이 생성한 롤아웃을 교사 모델에 전달해 각 토큰의 로그확률 또는 상위 k개 토큰의 로짓을 계산하는 연산이다. 이 연산을 별도 서비스로 분리하면 학생 샘플링과 병렬로 처리되어 전체 벽시계 시간 부담이 크게 증가하지 않는다. MOPD에서는 교사 프리필을 비동기 서비스로 배치해 오버헤드를 숨겼다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 29.수집 2026. 07. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.