본문으로 건너뛰기

SlimQwen: 대형 MoE 모델 pre-training에서의 structured pruning 및 knowledge distillation 탐구

대형 MoE LLM의 사전학습은 비용이 큰 문제다. 본 연구는 depth/width/experts를 모두 포함하는 구조적 pruning과 추후 학습 전략으로 프리training에서의 성능 회복을 분석하고, progressively pruning이 one-shot보다 더 안정적이고 효과적임을 보여준다. 또한 NTP KD와 LM loss의 결합과 MTP KD가 지식 집중형 태스크에서 이점을 준다.

용어 해설

MoE(혼합-전문가)(MoE (Mixture-of-Experts))
MoE는 입력에 따라 다수의 Expert 중 일부를 선택적으로 활성화해 계산 자원을 절약하고, 모델 규모 확장을 가능하게 하는 아키텍처이다. 각 Expert는 독립적인 파라미터를 가지며, 라우터는 토큰별로 활성화할 Expert들을 결정한다. 이와 같은 구조는 파라미터 효율성과 연산 집중화의 균형에 의존한다.
가지치기(pruning)
네트워크의 일부 모듈(예: Layer, Hidden Dimension, Expert)을 제거해 파라미터 수를 줄이는 방법으로, 구조적 pruning은 실행 중인 아키텍처에서 직접 속도 향상과 메모리 감소를 유도한다.
지식 증류(knowledge distillation)
교사 모델의 확률 분포를 학생 모델에 전달해 학습을 돕는 방법으로, KD는 프루닝 후 손실 보완에 자주 활용된다.
멀티토큰 예측(Multi-Token Prediction)
다음 토큰 하나가 아니라 다수의 미래 토큰을 예측하도록 하는 distillation 모듈로, backbone 학습 및 speculative decoding의 효율성을 높인다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 09.수집 2026. 05. 13.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.