TL;DR
이 게시물은 ds4 런타임에 Metal 경로와 SSD 기반 스트리밍 캐시를 추가해 Qwen3.6-35B-A3B 같은 대형 모델을 16GB Mac에서도 실행 가능하게 만든 작업을 소개하고 있다. 구현은 라우팅된 전문가의 가중치를 통합 메모리의 제한된 캐시에 유지하고 누락분을 SSD에서 스트리밍해 로드하는 방식으로 동작하며, 런타임과 변환기·벤치마크가 리포지토리에 포함되어 재현이 가능하다. M1 Pro 16GB에서 측정한 워밍 미디언 성능은 사전채우기 15.04 tok/s, 생성 9.77 tok/s로 보고되었고 메모리 압력과 스왑 동작에는 이상이 없었다. 이 접근은 RAM 제약이 있는 소비자 장비에서 대형 모델을 실사용 수준으로 돌리는 실용적 대안이지만 실험적 상태와 디스크 I/O 트레이드오프가 존재한다.
실용적 조언
- 작업 환경에서 대형 Q4_K_S 형식 모델을 16GB 장비에 배치하려면 우선 모델을 GGUF 레이아웃으로 변환하고 런타임이 제공하는 캐시 설정을 조정해 활성 전문가 집합의 메모리 상주량을 제한해야 한다. 변환 과정은 리포지토리의 변환기를 사용해 진행하고, 런타임 실행 시 캐시 히트율과 SSD 읽기 횟수를 모니터링해 스트리밍 오버헤드를 확인해야 한다. 벤치마크를 반복해 사전채우기와 생성 단계의 토큰 처리율을 비교하고 메모리 압력 지표와 스왑 카운터를 관찰하면 실제 응답성·처리량·디스크 I/O 사이의 트레이드오프를 파악할 수 있다.
섹션별 상세
용어 해설
- Mixture of Experts
- — 큰 모델을 여러 전문가(expert) 서브네트워크로 분할하고 요청에 따라 일부 전문가만 활성화해 계산량을 줄이는 방식으로, 입력 토큰에 따라 라우터가 활성화할 전문가를 선택해 필요한 가중치만 로드하거나 계산해 효율성을 확보한다.
- GGUF
- — 모델 가중치와 메타데이터를 저장하는 경량 이진 형식으로, 변환기를 통해 다른 런타임에서 읽을 수 있게 레이아웃을 맞추며 디스크 기반 배포와 부분 로딩을 지원하는 점이 중요하다.
- Unified Memory
- — CPU와 GPU가 물리적으로 공유하거나 커널 수준에서 메모리 접근을 조율하는 메모리 모델로, 메모리 이동을 줄이고 GPU 측 코드가 필요 시 CPU 메모리 영역을 손쉽게 참조하거나 페이지를 이동시켜 대용량 모델의 부분 로딩을 용이하게 한다.
언급된 도구
DeepSeek 4 Flash 기반 로컬 추론 엔진의 런타임으로, Metal 경로와 SSD 스트리밍을 통해 대형 모델의 부분 로딩과 실행을 지원한다
모델 가중치와 레이아웃을 저장하는 포맷 및 변환 체인으로, 런타임에서 부분 로딩과 변형된 레이아웃을 사용하도록 한다
macOS/iOS 플랫폼에서 GPU 가속을 제공하는 그래픽·컴퓨팅 API로, 런타임이 모델 연산을 GPU로 오프로드하는 데 사용된다
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.