본문으로 건너뛰기

Crosslingual On-Policy Self-Distillation for Multilingual Reasoning

다국어 대형언어모델의 수학 추론은 일반적으로 고자원 언어에서만 우수하다. COPSD는 같은 모델을 학생과 교사로 사용하되, 교사에게 영어 등 고자원 언어의 privileged 정보를 제공해 저자원 언어에서의 추론 성능을Dense하게 향상시킨다. 이로써 저자원 언어에서도 더 나은 문제해결 흐름을 얻도록 한다.

용어 해설

온-정책 자기 증류(On-Policy Self-Distillation)
동일 모델이 학생과 교사 역할을 교대하며, 학생의 롤아웃에서 교사가 y∗(참고 해결책)과 영어 번역 정보를 활용해 분포를 정제하는Dense 감독 학습 방법이다. 다중 언어에서의 추론 능력을 외부 교사 없이도 개선한다.
크로스링구얼 프리빌리지 정보(Crosslingual Privileged Information)
고자원 언어의 문제 텍스트와 해설 같은 privileged 정보를 교사에게 제공해 저자원 언어의 추론 분포를 강화하는 전략이다.
토큰 수준 발산(Token-level Divergence)
교사와 학생의 다음 토큰 분포 간 차이를 각 토큰마다 측정하고 최소화하는 손실로Dense한 중간 추론 피드백을 제공한다.
테스트 시점 확장(Test-time Scaling)
추론 시점에 더 많은 생성 예산을 허용해 더 긴 추론 경로를 탐색하도록 모델의 탐색 능력을 확장하는 현상이다.
저자원 언어(Low-resource Languages)
데이터 노출이 제한된 언어군으로 COPSD의 교차언어 추론 지식전이가 큰 효과를 발휘한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 10.수집 2026. 05. 13.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.