본문으로 건너뛰기
r/LocalLLaMA조회 5

Qwen 3.5 2B 모델의 압도적 성능과 M1 Mac 환경에서의 파인튜닝 메모리 문제

Qwen 3.5 2B 모델이 벤치마크에서 뛰어난 효율성을 보였으나, M1 Mac 8GB 환경에서 QLoRA 학습 시 지속적인 OOM 오류가 발생하고 있다.

커뮤니티 반응

사용자는 자신의 설정 문제인지 혹은 다른 사용자들도 mlx_lm이나 다른 라이브러리에서 유사한 문제를 겪고 있는지 확인하고자 하며, Qwen 3.5의 높은 성능 대비 학습 난이도에 주목하고 있다.

실용적 조언

  • 8GB RAM Mac 사용자라면 Qwen 3.5 파인튜닝 시도 전 mlx_lm의 최신 이슈 리포트를 확인하고 Rank 값을 최소화할 것
  • 동일 환경에서 Mistral 계열 모델은 학습이 가능하므로 하드웨어 한계보다는 소프트웨어 스택의 최적화 상태를 먼저 점검할 것

섹션별 상세

Qwen 3.5 2B 모델의 벤치마크 성능이 체급 대비 매우 이례적이다. MMLU-Pro 스코어 66.5를 기록하며 Llama 3.1 70B, Mistral Small 3(24B), Qwen2 72B 등 훨씬 거대한 모델들을 능가하는 성능을 입증했다.
M1 MacBook Pro(8GB RAM) 환경에서 QLoRA 4비트 양자화를 적용해 파인튜닝을 시도했다. 시퀀스 길이를 128까지 낮추고 배치 사이즈를 1로 설정했음에도 불구하고 2B 모델은 물론 0.8B 모델조차 실행 즉시 OOM 오류가 발생했다.
사용자는 기존에 Mistral 7B나 Ministral 3 3B 모델을 동일 기기에서 낮은 설정으로 학습시킨 경험이 있다. 따라서 Qwen 3.5 모델에서만 발생하는 이 문제가 라이브러리(mlx_lm)의 특정 버그인지 혹은 모델 아키텍처의 특성 때문인지에 대한 의문이 제기됐다.
소프트웨어 재설치, 라이브러리 업데이트, 데이터셋 변경 등 가능한 모든 환경 조정을 시도했으나 결과는 동일했다. 이는 Qwen 3.5 모델이 학습 시 점유하는 활성화(Activation) 메모리나 KV 캐시 구조가 기존 모델들과 다를 가능성을 시사한다.

용어 해설

MMLU-Pro 벤치마크(MMLU-Pro)
기존 MMLU보다 난이도가 높은 대규모 다중 작업 언어 이해 벤치마크이다. 더 복잡한 추론과 지식을 요구하며 모델의 실제 지적 능력을 정밀하게 측정하는 지표로 활용된다.
양자화 저순위 적응(QLoRA)
4비트 양자화를 통해 모델 가중치를 압축한 상태에서 LoRA 파인튜닝을 수행하는 기법이다. 메모리 사용량을 획기적으로 줄여 일반 소비자용 GPU에서도 대형 모델 학습을 가능하게 한다.
메모리 부족 오류(OOM)
시스템의 가용 메모리가 프로세스가 요구하는 자원보다 부족할 때 발생하는 오류이다. LLM 학습 시 모델 가중치, 그래디언트, 옵티마이저 상태 등이 VRAM 용량을 초과하면 발생한다.
MLX 언어 모델 라이브러리(MLX-LM)
Apple Silicon 하드웨어에 최적화된 MLX 프레임워크 기반의 LLM 라이브러리이다. macOS 환경에서 효율적인 추론과 파인튜닝 기능을 제공한다.

언급된 도구

mlx_lm중립

macOS용 LLM 추론 및 학습 라이브러리

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 16.수집 2026. 03. 16.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.