본문으로 건너뛰기
r/LocalLLaMA조회 15

Mac Mini 32GB 모델의 로컬 LLM 성능 벤치마크 결과

Mac Mini 32GB 환경에서 Unsloth 20B 모델을 실행하여 초당 34토큰의 추론 속도와 0.7초의 첫 토큰 생성 시간을 기록한 성능 공유 게시물이다.

실용적 조언

  • Mac Mini 32GB 사용자는 20B 규모의 GGUF 모델을 Q4 양자화로 사용할 때 쾌적한 속도를 기대할 수 있다.
  • 긴 컨텍스트 사용 시 Flash Attention 옵션을 반드시 활성화하여 지연 시간을 단축하라.

섹션별 상세

01
Mac Mini 32GB 모델에서 Unsloth의 gpt-oss-20b-Q4_K_S.gguf 모델을 사용하여 성능을 측정했다. 20B 규모의 모델임에도 불구하고 4비트 양자화(Q4_K_S)를 적용하여 32GB 통합 메모리 환경에서 안정적으로 구동됨을 확인했다.
02
추론 속도는 초당 34토큰(34 tok/s)으로 나타났다. 이는 일반적인 읽기 속도보다 빠르며, 로컬 환경에서 20B 모델을 실사용하기에 충분히 쾌적한 수준의 성능임을 시사한다.
03
첫 토큰 생성 시간(TTFT)은 0.7초를 기록했다. 컨텍스트 크기를 26,035로 설정하고 Flash Attention을 활성화한 상태에서 얻은 결과로, 대규모 문맥 처리 시에도 초기 응답 지연이 매우 낮음을 보여준다.
04
세부 설정으로 GPU 오프로드 레이어 18개, CPU 스레드 풀 7개, 최대 동시 실행 4개, 전문가 수 4개를 적용했다. 특히 Flash Attention 옵션을 켜서 메모리 효율과 속도를 최적화한 것이 성능 유지의 핵심 요인으로 분석된다.

용어 해설

첫 토큰 생성 시간(TTFT)
Time To First Token의 약자로, 사용자가 프롬프트를 입력한 시점부터 모델이 첫 번째 응답 토큰을 출력할 때까지 걸리는 지연 시간이다. 로컬 LLM 환경에서 시스템의 반응성을 판단하는 핵심 지표로 활용된다.
GGUF 포맷(GGUF)
llama.cpp 프로젝트에서 개발한 바이너리 파일 포맷으로, 모델 가중치를 효율적으로 저장하고 CPU/GPU 간의 빠른 로딩을 지원한다. 특히 로컬 환경에서 다양한 양자화 설정을 적용하여 모델을 실행할 때 표준처럼 사용된다.
플래시 어텐션(Flash Attention)
어텐션 메커니즘의 연산 속도를 높이고 메모리 사용량을 줄이기 위해 설계된 알고리즘이다. GPU 메모리 계층 구조를 효율적으로 활용하여 긴 컨텍스트를 처리할 때 성능 저하를 최소화한다.
GPU 오프로드(GPU Offload)
모델의 연산 레이어 중 일부를 비디오 메모리(VRAM)로 옮겨 처리하는 기법이다. 통합 메모리를 사용하는 Apple Silicon 환경에서도 특정 레이어를 GPU 가속기에 할당하여 전체 추론 속도를 높이는 데 기여한다.

언급된 도구

LM Studio추천

로컬 LLM 실행 및 관리 인터페이스

Unsloth추천

LLM 파인튜닝 및 최적화 라이브러리

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 18.수집 2026. 03. 18.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.