본문으로 건너뛰기
r/LocalLLaMA조회 2

DeepSeek-V4-Flash SSD 스트리밍 실행

전문가를 SSD에서 스트리밍한 DeepSeek-V4-Flash가 64 GB Mac에서 공개 수치와 같은 품질을 기록했다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 165 GB 크기의 DeepSeek-V4-Flash를 라우팅된 전문가만 SSD에서 읽는 방식으로 64 GB M5 Pro Mac에서 실행했고, wikitext 퍼플렉서티 6.1250으로 공개 수치 6.1262와 거의 같은 품질을 얻었습니다. 8 GB 전문가 캐시는 32 GB보다 빠른 2.04 tok/s를 기록했으며, ds4에서도 5.1 GB 상주 메모리로 11.4 tok/s를 냈습니다. SSD I/O가 병목인 조건에서는 speculative decoding과 expert prefetch가 처리량을 낮췄고, AQLM 계열 2-bit 양자화는 퍼플렉서티를 9.4% 높여 품질 기준을 통과하지 못했습니다.

주요 논점

01찬성다수

SSD에서 라우팅된 전문가를 필요할 때 읽는 방식은 165 GB 모델을 64 GB Mac에서 실행하면서도 wikitext 퍼플렉서티를 공개 수치와 거의 동일하게 유지했습니다. 작은 캐시가 큰 캐시보다 빠르고 ds4에서도 같은 결과가 재현돼, OS page cache 중심의 스트리밍 설계가 실용적이라는 근거가 제시됐습니다.

02반대소수

추측 디코딩과 전문가 프리페치는 SSD I/O가 병목인 조건에서 추가 데이터 읽기를 발생시켜 처리량을 높이지 못했습니다. 2-bit AQLM 계열 양자화도 퍼플렉서티가 9.4% 증가해 품질 기준을 충족하지 못했습니다.

합의점 vs 논쟁점

합의점

  • 165 GB 모델을 64 GB Mac에서 전문가 스트리밍으로 실행할 수 있었고, 스트리밍 경로의 wikitext 퍼플렉서티 6.1250은 공개 수치 6.1262와 거의 같았습니다.
  • 8 GB 전문가 캐시가 32 GB 캐시보다 빠른 측정 결과가 나왔으며, ds4 엔진에서도 같은 경향이 재현됐습니다.

논쟁점

  • 전문가 스트리밍과 작은 캐시의 우수성은 제시된 M5 Pro Mac과 SSD I/O 병목 조건의 측정에 근거하므로, 다른 저장장치나 하드웨어에서도 같은 처리량이 나오는지는 확인되지 않았습니다.
  • 2-bit AQLM 계열 양자화의 품질 저하는 6개 레이어 부분집합 기준이므로 전체 모델에서 동일한 증가폭이 나타나는지는 본문 수치만으로 판단하기 어렵습니다.

실용적 조언

  • 전문가 캐시를 무조건 크게 잡기보다 8 GB와 32 GB처럼 여러 크기를 sweep해 디코드·프리필·RSS를 함께 측정하는 편이 적절합니다.
  • SSD 읽기가 병목인 환경에서는 speculative decoding이나 expert prefetch를 기본 활성화하기 전에 추가 바이트 읽기가 숨겨지는 지연 시간보다 작은지 확인해야 합니다.
  • 저비트 양자화를 적용할 때는 전체 모델의 평균 비트폭만 보지 말고 레이어별 working set과 퍼플렉서티를 함께 측정해야 합니다.

섹션별 상세

01
작성자는 165 GB 크기의 DeepSeek-V4-Flash를 64 GB M5 Pro Mac에서 2주간 실행했습니다. 혼합 4/8-bit 모델 전체를 메모리에 적재하는 대신 라우팅된 전문가를 요청 시 SSD에서 읽는 스트리밍 경로를 사용했습니다. 전체 wikitext의 퍼플렉서티는 6.1250으로, 해당 체크포인트의 공개 수치 6.1262와 거의 같아 스트리밍 과정에서 품질 손실이 없다는 결론을 뒷받침했습니다.
02
전문가 캐시를 크게 늘리는 방식은 오히려 디코드 성능을 낮췄습니다. 8 GB 캐시는 2.04 tok/s였지만 32 GB 캐시는 1.23 tok/s에 그쳤고, antirez의 ds4 엔진에서도 권장된 32 GB보다 8 GB가 디코드·프리필·RSS 측면에서 우수했습니다. 같은 장비에서 ds4는 5.1 GB 상주 메모리로 11.4 tok/s를 기록해, OS page cache가 별도 대형 전문가 캐시보다 실제 작업을 더 효과적으로 처리한다는 결과를 냈습니다.
03
SSD I/O가 병목인 환경에서는 지연 시간을 숨기려는 추가 최적화가 읽기량을 늘려 처리량을 떨어뜨렸습니다. Prompt-lookup speculation은 기준 대비 0.44~0.96배에 머물렀고, 다음 레이어 전문가를 미리 읽는 pre-gated prefetch도 70~77%의 예측 정확도에도 불구하고 속도를 높이지 못했습니다. 즉 전문가를 더 일찍 읽는 전략보다 필요한 데이터만 읽어 전체 바이트 전송량을 줄이는 전략이 해당 실행 조건에 더 적합했습니다.
04
AQLM 계열 codebook 2-bit 양자화는 사전 등록된 품질 기준을 통과하지 못했습니다. 6개 레이어 부분집합에서 퍼플렉서티가 9.4% 증가했으며, 그 결과는 일반 affine 2-bit 양자화와 거의 같은 수준이었습니다. 저장 공간을 줄이는 비트폭 자체보다 레이어별 working set과 품질 변화를 함께 측정해야 한다는 점을 보여주며, 저장소에는 sweep 절차와 6개의 실패 접근 및 원인이 기록돼 있습니다.

용어 해설

혼합 전문가 모델(Mixture of Experts)
여러 전문가 네트워크 중 일부만 입력에 따라 선택해 계산하는 구조입니다. 라우팅된 전문가 가중치를 SSD에서 필요한 순간에 읽으면 전체 모델을 메모리에 올리지 않고도 추론할 수 있어, 대규모 모델의 실행 메모리 요구량을 낮추는 데 중요합니다.
퍼플렉서티(Perplexity)
언어 모델이 다음 토큰을 얼마나 잘 예측하는지 나타내는 평가 지표입니다. 값이 낮을수록 텍스트 예측이 정확하다는 뜻이며, 스트리밍이나 양자화 전후의 품질 차이를 수치로 비교하는 데 사용됩니다.
추측 디코딩(Speculative Decoding)
작은 모델이나 별도 예측기가 후보 토큰을 먼저 생성하고 큰 모델이 이를 검증하는 추론 최적화 기법입니다. 검증할 후보를 추가로 처리해야 하므로, SSD 읽기가 병목인 환경에서는 오히려 처리량이 낮아질 수 있습니다.
전문가 프리페치(Expert Prefetch)
다음 레이어에서 사용할 전문가 가중치를 미리 읽어 대기 시간을 숨기는 방식입니다. 이 글에서는 다음 전문가 예측 정확도가 70~77%였지만 추가 읽기 비용 때문에 속도 향상으로 이어지지 않았습니다.
AQLM 양자화(AQLM)
가중치를 낮은 비트 수로 표현해 모델 저장 공간과 메모리 사용량을 줄이는 양자화 계열입니다. 글의 2-bit 실험에서는 6개 레이어 부분집합의 퍼플렉서티가 9.4% 증가해 사전 등록 품질 기준을 통과하지 못했습니다.

언급된 도구

ds4중립링크

DeepSeek-V4-Flash의 전문가 스트리밍 추론을 재현하는 엔진으로, 글에서는 8 GB 캐시가 32 GB보다 빠른지 디코드·프리필·RSS 측정에 사용했습니다.

DeepSeek-V4-Flash중립

전문가를 SSD에서 요청 시 읽는 방식으로 64 GB Mac에서 실행한 165 GB 언어 모델입니다.

AQLM비추천

Codebook 2-bit 양자화 실험에 사용된 양자화 계열이며, 6개 레이어 부분집합에서 품질 기준을 평가받았습니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.