용어 해설
- On-Policy Distillation
- — 학생 모델이 직접 생성한 rollout을 학습 자료로 사용하면서 교사 모델의 토큰별 확률 정보를 학습 신호로 전달하는 방법입니다. 전체 궤적에 하나의 보상만 부여하는 강화학습보다 촘촘한 피드백을 제공하지만, 교사가 틀린 답을 높은 확률로 생성하면 그 오류도 학생에게 강하게 전달될 수 있습니다.
- Reverse KL
- — 학생 분포를 교사 분포에 맞추는 방향의 KL 발산입니다. 교사의 높은 확률 행동에 학생의 확률을 집중시키는 mode-seeking 특성이 있어 신뢰할 수 있는 교사에서는 빠른 학습을 돕지만, 교사가 확신에 찬 오답을 내면 해당 오류를 증폭할 수 있습니다.
- 교사 신뢰도(Teacher Reliability)
- — 특정 프롬프트에서 교사가 생성한 답이 verifier의 정답 판정을 통과할 확률입니다. TGOPD는 교사의 자체 confidence나 entropy 대신 같은 프롬프트에서 여러 probe를 생성하고 verifier 통과율을 계산해 신뢰도를 추정합니다.
- Verifier 채점 Probe(Verifier-Scored Probe)
- — 교사가 특정 프롬프트에 대해 생성한 추가 답변을 자동 verifier로 채점하는 샘플입니다. 통과한 probe 수를 전체 probe 수로 나누면 해당 프롬프트에서 교사 답변이 맞을 가능성을 추정할 수 있으며, 이 값이 기준을 넘을 때만 dense distillation을 허용합니다.
- 비동기 OPD(Asynchronous OPD)
- — 학생의 rollout 생성과 교사의 확률 계산을 서로 다른 노드에서 겹쳐 수행하는 OPD 배치 방식입니다. 교사의 forward scoring은 학생이 토큰을 모두 생성한 뒤에야 시작되고 계산 시간이 짧아 대기 시간이 길어집니다. TGOPD는 이 유휴 구간에 reliability probe를 실행합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
