본문으로 건너뛰기

Muon으로 Adam-Pretrained 모델의 파인튜닝 가능성에 관한 연구

대형 언어 모델의 사전학습에 Muon의 효율성이 주목되지만, 대부분의 공개 모델은 Adam으로 사전학습되어 파인튜닝 시 성능 저하가 발생한다. LoRA를 통해 업데이트를 제한하면 Muon과 Adam 간의 implicit bias 차이를 완화하고, 다수의 태스크에서 Muon의 파인튜닝 효과를 실현 가능하게 한다.

용어 해설

Muon 옵티마이저(Muon)
Muon은 뉴턴-슈울츠 Newton-Schulz 절차를 이용해 업데이트 방향을 직교화하는 행렬 레벨 전처리 옵티마이저로, 모듈러한 파라미터 형태의 가중치 업데이트에서 균일한 특이값 분포를 유도한다.
LoRA
LoRA는 pretrained 가중치를 고정하고 저랭크 행렬 B, A를 학습해 업데이트를 제한하는 파라미터 효율적 파인튜닝 방법이다; W = W0 + αBA로 표현된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 11.수집 2026. 05. 13.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.