용어 해설
- 온-정책 자기 증류(On-Policy Self-Distillation)
- — 동일 모델이 학생과 교사 역할을 교대하며, 학생의 롤아웃에서 교사가 y∗(참고 해결책)과 영어 번역 정보를 활용해 분포를 정제하는Dense 감독 학습 방법이다. 다중 언어에서의 추론 능력을 외부 교사 없이도 개선한다.
- 크로스링구얼 프리빌리지 정보(Crosslingual Privileged Information)
- — 고자원 언어의 문제 텍스트와 해설 같은 privileged 정보를 교사에게 제공해 저자원 언어의 추론 분포를 강화하는 전략이다.
- 토큰 수준 발산(Token-level Divergence)
- — 교사와 학생의 다음 토큰 분포 간 차이를 각 토큰마다 측정하고 최소화하는 손실로Dense한 중간 추론 피드백을 제공한다.
- 테스트 시점 확장(Test-time Scaling)
- — 추론 시점에 더 많은 생성 예산을 허용해 더 긴 추론 경로를 탐색하도록 모델의 탐색 능력을 확장하는 현상이다.
- 저자원 언어(Low-resource Languages)
- — 데이터 노출이 제한된 언어군으로 COPSD의 교차언어 추론 지식전이가 큰 효과를 발휘한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





