본문으로 건너뛰기
Simon Willison조회 36

Apple의 LLM in a Flash 기법을 활용한 Qwen 397B 모델의 로컬 실행 연구

Apple의 LLM in a Flash 연구를 적용하여 48GB RAM 환경에서 209GB 규모의 Qwen 397B MoE 모델을 초당 5.5토큰 속도로 실행하는 최적화 기법을 소개한다.

섹션별 상세

Qwen3.5-397B-A17B 모델을 48GB RAM의 MacBook Pro M3 Max에서 초당 5.5토큰 이상의 속도로 실행했다. 이 모델은 디스크 용량이 209GB에 달하며 4비트 양자화 시에도 120GB를 차지하지만, MoE 구조를 활용해 전체 가중치를 메모리에 올리지 않고도 추론이 가능하다.
Apple의 2023년 논문 'LLM in a Flash'에서 제안된 기법을 핵심으로 사용했다. 플래시 메모리(SSD)의 특성을 고려한 추론 비용 모델을 구축하고, 데이터 전송량을 줄이면서 연속적인 대량 읽기를 최적화하여 필요한 전문가 가중치를 즉각적으로 DRAM으로 불러온다.
Claude Code와 Andrej Karpathy의 'autoresearch' 패턴을 결합하여 최적화 과정을 자동화했다. Claude가 90번의 실험을 직접 수행하며 MLX, Objective-C, Metal 기반의 고성능 코드를 생성했으며, 최종적으로 danveloper/flash-moe 저장소에 결과물을 공개했다.
모델의 전문가(Experts) 부분은 2비트로 양자화하고, 임베딩 테이블과 라우팅 매트릭스 등 핵심 요소는 원본 정밀도를 유지하여 약 5.5GB의 상주 메모리만 사용하도록 설계했다. 또한 토큰당 활성화되는 전문가 수를 기존 10개에서 4개로 줄여 연산 효율을 극대화했다.

용어 해설

전문가 혼합 모델(Mixture-of-Experts)
모델의 전체 파라미터를 모두 사용하는 대신, 입력 토큰마다 관련 있는 일부 전문가(Expert) 네트워크만 활성화하여 연산 효율을 극대화하는 아키텍처이다. 이를 통해 모델의 전체 크기는 키우면서도 실제 추론에 필요한 연산량과 메모리 점유율을 낮게 유지할 수 있다.
양자화(Quantization)
모델의 가중치를 표현하는 비트 수를 줄여 메모리 사용량을 절감하고 연산 속도를 높이는 기법이다. 예를 들어 16비트 부동소수점을 2비트나 4비트 정수로 변환하며, 이 과정에서 발생하는 정보 손실을 최소화하는 것이 핵심 기술력이다.
플래시 메모리 추론(Flash Memory Inference)
모델 가중치 전체를 RAM에 올리지 않고 고속 SSD(Flash Memory)에 저장해 둔 뒤, 추론 시점에 필요한 가중치만 DRAM으로 스트리밍하여 사용하는 방식이다. RAM 용량이 모델 크기보다 작은 환경에서 초거대 모델을 실행할 수 있게 해준다.

기술

  • Qwen 3.5
  • MLX
  • Metal
  • Claude Code
  • Objective-C

활용 사례

  • 제한된 메모리 환경에서의 초거대 모델 실행
  • 로컬 AI 에이전트 구축
  • 저비용 LLM 추론 실험
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 19.수집 2026. 03. 19.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.