본문으로 건너뛰기
r/LLMDevs조회 4

andreaborio/ds4: Metal 및 CUDA용 DeepSeek 4 Flash 로컬 추론 엔진

DS4에 Metal 경로와 SSD 스트리밍 기반 전문가 캐시를 더해 Qwen3.6-35B-A3B를 16GB Mac에서 실사용 수준으로 동작시켰으며 사전채우기 15.04 tok/s·생성 9.77 tok/s의 워밍 미디언 성능을 기록했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 게시물은 ds4 런타임에 Metal 경로와 SSD 기반 스트리밍 캐시를 추가해 Qwen3.6-35B-A3B 같은 대형 모델을 16GB Mac에서도 실행 가능하게 만든 작업을 소개하고 있다. 구현은 라우팅된 전문가의 가중치를 통합 메모리의 제한된 캐시에 유지하고 누락분을 SSD에서 스트리밍해 로드하는 방식으로 동작하며, 런타임과 변환기·벤치마크가 리포지토리에 포함되어 재현이 가능하다. M1 Pro 16GB에서 측정한 워밍 미디언 성능은 사전채우기 15.04 tok/s, 생성 9.77 tok/s로 보고되었고 메모리 압력과 스왑 동작에는 이상이 없었다. 이 접근은 RAM 제약이 있는 소비자 장비에서 대형 모델을 실사용 수준으로 돌리는 실용적 대안이지만 실험적 상태와 디스크 I/O 트레이드오프가 존재한다.

실용적 조언

  • 작업 환경에서 대형 Q4_K_S 형식 모델을 16GB 장비에 배치하려면 우선 모델을 GGUF 레이아웃으로 변환하고 런타임이 제공하는 캐시 설정을 조정해 활성 전문가 집합의 메모리 상주량을 제한해야 한다. 변환 과정은 리포지토리의 변환기를 사용해 진행하고, 런타임 실행 시 캐시 히트율과 SSD 읽기 횟수를 모니터링해 스트리밍 오버헤드를 확인해야 한다. 벤치마크를 반복해 사전채우기와 생성 단계의 토큰 처리율을 비교하고 메모리 압력 지표와 스왑 카운터를 관찰하면 실제 응답성·처리량·디스크 I/O 사이의 트레이드오프를 파악할 수 있다.

섹션별 상세

01
안드레아보리오가 antirez의 ds4 런타임에 Metal 경로를 추가해 Qwen3.6-35B-A3B 모델을 macOS 상에서 GPU를 이용해 실행 가능하게 만들었다. 런타임은 모델의 연산을 Metal API로 전달해 GPU에서 행렬 연산과 레이어 실행을 처리하고, 결과 토큰을 반환하는 방식으로 작동한다. 게시물과 리포지토리에는 런타임 코드와 변환 도구 및 벤치마크가 포함되어 있어 구현과 성능 측정 근거가 명시되어 있다. 이로 인해 macOS 환경에서도 네이티브 GPU 경로를 사용해 대형 모델을 돌리는 실험적 실현이 이루어졌다.
02
원저자는 메모리 제약 문제를 해결하기 위해 라우팅된 전문가들의 가중치를 통합 메모리에 제한된 캐시로 유지하고 누락분은 SSD에서 스트리밍하는 전략을 도입했다. 구체적으로 입력이 들어오면 라우터가 활성화할 전문가를 결정하고 런타임은 해당 전문가의 가중치가 캐시에 있으면 즉시 사용하며, 캐시에 없으면 SSD에서 해당 블록을 읽어 통합 메모리에 배치한 뒤 연산을 진행하는 흐름이다. 게시물에는 Q4_K_S 모델 크기가 약 20.8GB이어서 16GB 시스템에서는 전부 상주할 수 없다는 점이 근거로 제시되었다. 이 접근은 RAM이 부족한 소비자 장비에서 대형 MoE 스타일 또는 분할 가중치 모델을 실행할 수 있게 하는 실용적 트레이드오프를 만든다.
03
실사용 성능 측정에서 M1 Pro 16GB 기기에서 프로덕션 빌드의 네 번 실행한 워밍 미디언 결과가 사전채우기(prefill)에서 분당 토큰 처리율 15.04 tok/s, 생성 단계에서 9.77 tok/s로 보고되었다. 벤치마크 절차는 동일한 입력을 반복해 캐시 상태와 토큰 처리 속도를 측정하는 방식으로 실행되었고, 메모리 압력은 정상 범위였으며 스왑아웃 카운터가 증가하지 않은 점이 관찰 근거로 제시되었다. 이 수치는 완전 상주 모델에 비해 낮을 수 있으나 16GB 한정의 장치에서 대형 모델을 실사용 가능한 수준으로 구동할 수 있음을 입증하는 실전 근거로 해석된다.
04
리포지토리는 Qwen 런타임, ExpertMajor GGUF 레이아웃과 변환기, 벤치마크 세부 정보 및 공개 GGUF 파일 링크를 포함하고 있어 재현과 테스트가 가능하게 구성되어 있다. 사용자나 개발자는 제공된 변환기를 이용해 모델을 GGUF 레이아웃으로 변환하고 런타임에서 해당 파일을 로드해 벤치마크를 재실행할 수 있으며, 벤치마크 결과는 리포지토리의 문서로 연결되어 있다. 작성자는 이 구현을 실험적이라고 명시했지만 실제 16GB 장비에서 사용할 수 있게 되었음을 강조해 배포 목적과 한계가 명확하게 제시되었다. 따라서 다른 개발자들이 리포지토리를 기반으로 최적화나 추가 실험을 수행할 수 있는 토대가 마련되었다.

용어 해설

혼합 전문가(MoE) 라우팅(Mixture of Experts)
큰 모델을 여러 전문가(expert) 서브네트워크로 분할하고 요청에 따라 일부 전문가만 활성화해 계산량을 줄이는 방식으로, 입력 토큰에 따라 라우터가 활성화할 전문가를 선택해 필요한 가중치만 로드하거나 계산해 효율성을 확보한다.
GGUF 파일 형식(GGUF)
모델 가중치와 메타데이터를 저장하는 경량 이진 형식으로, 변환기를 통해 다른 런타임에서 읽을 수 있게 레이아웃을 맞추며 디스크 기반 배포와 부분 로딩을 지원하는 점이 중요하다.
통합 메모리(Unified Memory)
CPU와 GPU가 물리적으로 공유하거나 커널 수준에서 메모리 접근을 조율하는 메모리 모델로, 메모리 이동을 줄이고 GPU 측 코드가 필요 시 CPU 메모리 영역을 손쉽게 참조하거나 페이지를 이동시켜 대용량 모델의 부분 로딩을 용이하게 한다.

언급된 도구

ds4중립링크

DeepSeek 4 Flash 기반 로컬 추론 엔진의 런타임으로, Metal 경로와 SSD 스트리밍을 통해 대형 모델의 부분 로딩과 실행을 지원한다

GGUF중립

모델 가중치와 레이아웃을 저장하는 포맷 및 변환 체인으로, 런타임에서 부분 로딩과 변형된 레이아웃을 사용하도록 한다

Metal중립

macOS/iOS 플랫폼에서 GPU 가속을 제공하는 그래픽·컴퓨팅 API로, 런타임이 모델 연산을 GPU로 오프로드하는 데 사용된다

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 18.수집 2026. 07. 18.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.