본문으로 건너뛰기

서로 다른 토크나이저로 장문 증명을 증류하는 SimpleOPD

SimpleOPD가 공유 텍스트 정렬과 KL 제약으로 장문 교사의 증명 추론을 다른 토크나이저의 학생 모델에 전달합니다.

용어 해설

온폴리시 증류(On-Policy Distillation)
학생 모델이 직접 생성한 응답 궤적을 기준으로 교사 모델이 각 토큰의 확률을 평가하고, 그 차이를 이용해 학생 정책을 갱신하는 지식 전달 방식입니다. 고정된 교사 생성 데이터만 학습하는 방식과 달리 학생의 현재 행동 분포에 맞춘 촘촘한 토큰 단위 감독을 제공합니다.
토크나이저 불일치(Tokenizer Mismatch)
교사와 학생이 같은 문장을 서로 다른 토큰 경계와 어휘로 나누면서 토큰별 확률을 직접 대응하기 어려워지는 문제입니다. SimpleOPD는 두 모델이 공유하는 응답 문자열에서 시작·끝 텍스트 구간이 완전히 같은 토큰만 연결해 부정확한 확률 대응을 피합니다.
학생 기준 KL 손실(Student Reference KL Loss)
학습 중인 학생 정책이 학습 시작 시점의 초기 학생 정책에서 지나치게 멀어지지 않도록 제한하는 정규화 항입니다. 교사의 긴 추론 분포를 따라가면서도 학생의 원래 종료 능력과 일반 능력을 보존해 응답 길이 폭증과 잘림을 줄이는 역할을 합니다.
종료 토큰 어드밴티지 마스킹(Termination-Token Advantage Masking)
`</think>`와 `<|im_end|>`처럼 사고 과정이나 최종 응답을 끝내는 구조 토큰의 OPD 어드밴티지를 학습에서 제외하는 기법입니다. 긴 응답을 선호하는 교사의 신호가 학생의 종료 확률을 계속 낮추는 현상을 막아, 학생이 자신의 문맥 예산 안에서 생성 과정을 끝낼 수 있도록 합니다.
ProofBench
자연어 수학 증명 능력을 평가하는 벤치마크입니다. 논문에서는 SU-01에서 학생 모델로 증명 추론 능력이 전달됐는지 확인하는 핵심 지표로 사용했으며, Intern-S2-OPD는 평가 설정에 따라 34.0에서 55.2로 21.2포인트 상승했습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 14.수집 2026. 08. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.