본문으로 건너뛰기

Apple Silicon 기기별 LLM 추론 성능 벤치마크 분석

Apple Silicon 기기에서 LLM 추론을 수행하는 다양한 런타임의 처리량, 메모리 효율성, 발열 및 에너지 소비를 비교 분석한 벤치마크 리포트.

섹션별 상세

런타임별 성능 차이: MLX-Swift는 Qwen 3.5 2B 모델에서 61.2 tok/s를 기록하며 높은 처리량을 보였으나, LiteRT-LM은 Gemma 4 E2B 모델에서 더 높은 효율을 나타냈다.
iPhone 17 Pro에서의 런타임별 추론 처리량과 최대 메모리 점유율 비교 차트.
ChartLiteRT-LM이 Gemma 모델에서 가장 높은 처리량을 보이며, CoreML/ANE는 메모리 점유율이 가장 낮음을 보여준다. 런타임별로 성능과 메모리 효율의 트레이드오프가 명확히 나타난다.
메모리 효율성: CoreML/ANE는 chunked-MLKV 기술을 통해 Qwen 3.5 2B 모델을 241MB 메모리에서 구동하여 타 런타임 대비 약 5배 적은 메모리를 사용한다.
근거
  • CoreML/ANE는 Qwen 3.5 2B 모델을 241MB 메모리에서 구동하여 MLX의 1,279MB 대비 약 5배 적은 메모리를 사용한다. Peak memory 섹션 및 차트
발열 및 스로틀링: iPhone 17 Pro에서 GPU 기반 런타임(MLX, LiteRT-LM)은 지속적인 추론 시 60초 이내에 성능이 50% 이상 저하되는 스로틀링이 발생한다.
지속적인 추론 시 발생하는 런타임별 성능 저하(스로틀링) 곡선.
ChartGPU 기반 런타임은 초기 성능이 높으나 시간이 지남에 따라 급격히 하락하는 반면, ANE는 성능을 일정하게 유지함을 보여준다.
근거
  • GPU 기반 런타임은 지속적인 추론 시 60초 이내에 성능이 50% 이상 저하되는 스로틀링이 발생한다. Sustained decode throttling 섹션
에너지 효율: Apple Foundation Models는 GPU 기반 런타임 대비 토큰당 에너지 소비가 2배 낮으며, CoreML/ANE는 낮은 전력 소비를 보이나 처리 속도가 느려 토큰당 에너지 효율은 상대적으로 낮다.
처리량과 에너지 효율 간의 트레이드오프를 보여주는 산점도.
Chart각 런타임이 성능, 에너지, 메모리 중 어떤 측면에 최적화되어 있는지 시각적으로 비교한다.
토큰당 에너지 소비량 비교 차트.
ChartApple Foundation Models가 가장 높은 에너지 효율을 보이며, GPU 기반 런타임은 처리 속도가 빨라 토큰당 에너지 소비를 상쇄함을 나타낸다.
전체 추론 과정에서의 패키지 전력 소비량 비교.
ChartCoreML/ANE가 GPU 기반 런타임 대비 절반 수준의 전력을 소비함을 확인시켜 준다.

용어 해설

Apple Neural Engine(ANE)
Apple 실리콘 칩에 내장된 전용 신경망 처리 장치. 머신러닝 연산을 저전력으로 가속화하며, GPU와 별도로 작동하여 추론 시 메모리 효율성을 높이는 데 기여한다.
스로틀링(Throttling)
기기 발열을 제어하기 위해 프로세서의 클럭 속도를 강제로 낮추는 현상. LLM 추론과 같은 고부하 작업이 지속될 때 GPU 성능이 급격히 저하되는 주요 원인이다.
양자화(Quantization)
모델 가중치의 정밀도를 낮추어(예: FP16에서 INT4로) 모델 크기를 줄이고 추론 속도를 높이는 기법. 온디바이스 환경에서 메모리 제약을 극복하기 위해 필수적으로 사용된다.

코드 예제

bash
for run in 1 2 3; do
  yardstick run --task short-chat \
    --runtime mlx-swift \
    --model <model-id> \
    --output results/raw/---short-chat-run${run}.jsonl
done

벤치마크를 3회 반복 실행하여 안정적인 중앙값을 얻기 위한 명령어 예시

기술

  • MLX-Swift
  • llama.cpp
  • CoreML
  • LiteRT-LM
  • Apple Neural Engine

활용 사례

  • 온디바이스 LLM 추론 최적화
  • 모바일 기기 AI 성능 벤치마킹
  • 런타임별 에너지 효율 분석

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 04.수집 2026. 06. 04.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.