NLU(GLUE, T5-Base): Full-Adam 89.14, Full-Muon 88.77, LoRA-Adam 88.93, LoRA-Muon 88.97, LoRA-Muon-PE 89.20(최고)으로 LoRA-Muon-PE가 최고 성능이다. Full 파인튜닝에서 Muon이 Adam 대비 소폭 열세이나 LoRA를 사용하면 차이가 줄어들고, LoRA-Muon-PE가 최고치를 기록한다.
NLU(NLG): LLama 2-7B의 Math/Code/Commonsense에서 Full-Adam 54.92, Full-Muon 53.10, LoRA-Adam 51.62, LoRA-Muon 52.15, LoRA-Muon-PE 51.82. LoRA를 통한 Muon의 미스매치는 줄고, LoRA-Muon이 Math에서 LoRA-Adam과 근접, Code/Commonsense에서 우수한 측면을 보인다. Code-Feedback에서 13B 규모 HumanEval에서 LoRA-Muon이 LoRA-Adam과 비등하거나 우수한 경향을 보였다.
CV(CLIP ViT-B/32): 평균 성능은 Full-Adam 대비 Full-Muon의 차이가 작고, LoRA 설정에서 Muon 계열이 Adam 대비 우수하며, LoRA-Muon-PE가 평균적으로 최고를 기록한다. 메타 분석으로 Muon의 LoRA 기반 격차 감소 효과의 집계값은 Muon 0.72% (95% CI: [0.41, 1.04], p<0.001), Muon-PE 0.83% (95% CI: [0.45, 1.20], p<0.001)로 통계적으로 유의하게 감소한다.
LoRA 랭크 연구: 메타Math/Code-Feedback/StanfordCars에서 LoRA-Muon은 랭크 2–64에서 LoRA-Adam 대비 견고한 우위를 보이기도 하고, 랭크 증가 시 차이가 감소하거나 역전되는 경향이 있다. StanFordCars에서 LoRA-Muon이 대체로 우수하다. Catastrophic Forgetting: LoRA-Muon은 LoRA-Adam보다 Forgetting이 작아지는 경향을 보이며, 고랭크에서 Forgetting이 증가하는 반면 LoRA-Muon은 더 느리게 증가한다. LoRA-Granularity: LoRA 매트릭스의 스펙트럼 특성에서 Muon은 더 높은 stable rank와 엔트로피를 유지하며, 이는 pretrained 지식 보존에 유리하다. 컴퓨팅 효율: LoRA 하에서 Muon은 LoRA-Adam 대비 1.1–1.2× 느려지나 메모리 사용은 절감되며, CLIP에서 1.0–1.2× 이다. Muon의 옵티마이저 상태 메모리 절감은 약 50% 수준이다.