용어 해설
- 온폴리시 증류(On-Policy Distillation)
- — 학생 모델이 직접 생성한 응답 궤적을 기준으로 교사 모델이 각 토큰의 확률을 평가하고, 그 차이를 이용해 학생 정책을 갱신하는 지식 전달 방식입니다. 고정된 교사 생성 데이터만 학습하는 방식과 달리 학생의 현재 행동 분포에 맞춘 촘촘한 토큰 단위 감독을 제공합니다.
- 토크나이저 불일치(Tokenizer Mismatch)
- — 교사와 학생이 같은 문장을 서로 다른 토큰 경계와 어휘로 나누면서 토큰별 확률을 직접 대응하기 어려워지는 문제입니다. SimpleOPD는 두 모델이 공유하는 응답 문자열에서 시작·끝 텍스트 구간이 완전히 같은 토큰만 연결해 부정확한 확률 대응을 피합니다.
- 학생 기준 KL 손실(Student Reference KL Loss)
- — 학습 중인 학생 정책이 학습 시작 시점의 초기 학생 정책에서 지나치게 멀어지지 않도록 제한하는 정규화 항입니다. 교사의 긴 추론 분포를 따라가면서도 학생의 원래 종료 능력과 일반 능력을 보존해 응답 길이 폭증과 잘림을 줄이는 역할을 합니다.
- 종료 토큰 어드밴티지 마스킹(Termination-Token Advantage Masking)
- — `</think>`와 `<|im_end|>`처럼 사고 과정이나 최종 응답을 끝내는 구조 토큰의 OPD 어드밴티지를 학습에서 제외하는 기법입니다. 긴 응답을 선호하는 교사의 신호가 학생의 종료 확률을 계속 낮추는 현상을 막아, 학생이 자신의 문맥 예산 안에서 생성 과정을 끝낼 수 있도록 합니다.
- ProofBench
- — 자연어 수학 증명 능력을 평가하는 벤치마크입니다. 논문에서는 SU-01에서 학생 모델로 증명 추론 능력이 전달됐는지 확인하는 핵심 지표로 사용했으며, Intern-S2-OPD는 평가 설정에 따라 34.0에서 55.2로 21.2포인트 상승했습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

