용어 해설
- 온-폴리시 증류(On-Policy Distillation)
- — 학생 모델의 자체 롤아웃에서 생성된 토큰 경로를 이용해 교사의 토큰 확률분포로 학생을 맞추는 방법이다. 학생이 실제 추론 분포 상에서 학습하므로 노출 바이어스가 제거되고 토큰 수준의 촘촘한 신호가 제공된다. MOPD는 이를 여러 도메인 교사로 확장해 도메인별 라우팅을 적용한다.
- 노출 바이어스(Exposure Bias)
- — 오프폴리시 학습에서 발생하는 분포 불일치 문제로, 학습 시 사용한 교사 롤아웃과 학생의 추론 시 상태 분포가 달라 성능 저하가 발생한다. 학생이 교사 분포에만 적응하면 실제 추론에서 잘못된 토큰을 만나 오류가 누적된다. MOPD는 학생의 자체 롤아웃에서 학습해 이 문제를 구조적으로 제거한다.
- 역 KL(Reverse KL)
- — 학생 분포 π_theta를 기준으로 π_theta log(π_theta/π_phi) 형태로 측정하는 KL로, 학생이 교사 분포에 수렴하도록 확률 분포 전체를 조정하는 목적함수이다. 토큰 수준으로 적용하면 각 시점에서 학생이 교사 확률을 따라가도록 밀도 차이를 줄인다. MOPD는 이 값을 평균해 per-token 손실로 최적화한다.
- Top-K 증류(Top-K Distillation)
- — 교사의 전체 어휘 분포 대신 상위 k개의 토큰만 고려해 학생을 갱신하는 방법이다. 전송할 로그 확률·로짓의 양을 줄여 인프라 비용을 낮추는 한편, 잘라내기 편향을 보정하는 항을 추가해 수렴점의 일관성을 유지한다. MOPD는 k=64 등 실무적 설정으로 비교 실험을 수행했다.
- 교사 프리필(Teacher Prefill)
- — 학생이 생성한 롤아웃을 교사 모델에 전달해 각 토큰의 로그확률 또는 상위 k개 토큰의 로짓을 계산하는 연산이다. 이 연산을 별도 서비스로 분리하면 학생 샘플링과 병렬로 처리되어 전체 벽시계 시간 부담이 크게 증가하지 않는다. MOPD에서는 교사 프리필을 비동기 서비스로 배치해 오버헤드를 숨겼다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.