섹션별 상세
런타임별 성능 차이: MLX-Swift는 Qwen 3.5 2B 모델에서 61.2 tok/s를 기록하며 높은 처리량을 보였으나, LiteRT-LM은 Gemma 4 E2B 모델에서 더 높은 효율을 나타냈다.

메모리 효율성: CoreML/ANE는 chunked-MLKV 기술을 통해 Qwen 3.5 2B 모델을 241MB 메모리에서 구동하여 타 런타임 대비 약 5배 적은 메모리를 사용한다.
근거
- CoreML/ANE는 Qwen 3.5 2B 모델을 241MB 메모리에서 구동하여 MLX의 1,279MB 대비 약 5배 적은 메모리를 사용한다. — Peak memory 섹션 및 차트
발열 및 스로틀링: iPhone 17 Pro에서 GPU 기반 런타임(MLX, LiteRT-LM)은 지속적인 추론 시 60초 이내에 성능이 50% 이상 저하되는 스로틀링이 발생한다.

근거
- GPU 기반 런타임은 지속적인 추론 시 60초 이내에 성능이 50% 이상 저하되는 스로틀링이 발생한다. — Sustained decode throttling 섹션
에너지 효율: Apple Foundation Models는 GPU 기반 런타임 대비 토큰당 에너지 소비가 2배 낮으며, CoreML/ANE는 낮은 전력 소비를 보이나 처리 속도가 느려 토큰당 에너지 효율은 상대적으로 낮다.



용어 해설
- Apple Neural Engine(ANE)
- — Apple 실리콘 칩에 내장된 전용 신경망 처리 장치. 머신러닝 연산을 저전력으로 가속화하며, GPU와 별도로 작동하여 추론 시 메모리 효율성을 높이는 데 기여한다.
- 스로틀링(Throttling)
- — 기기 발열을 제어하기 위해 프로세서의 클럭 속도를 강제로 낮추는 현상. LLM 추론과 같은 고부하 작업이 지속될 때 GPU 성능이 급격히 저하되는 주요 원인이다.
- 양자화(Quantization)
- — 모델 가중치의 정밀도를 낮추어(예: FP16에서 INT4로) 모델 크기를 줄이고 추론 속도를 높이는 기법. 온디바이스 환경에서 메모리 제약을 극복하기 위해 필수적으로 사용된다.
코드 예제
bash
for run in 1 2 3; do
yardstick run --task short-chat \
--runtime mlx-swift \
--model <model-id> \
--output results/raw/---short-chat-run${run}.jsonl
done벤치마크를 3회 반복 실행하여 안정적인 중앙값을 얻기 위한 명령어 예시
기술
- MLX-Swift
- llama.cpp
- CoreML
- LiteRT-LM
- Apple Neural Engine
활용 사례
- 온디바이스 LLM 추론 최적화
- 모바일 기기 AI 성능 벤치마킹
- 런타임별 에너지 효율 분석
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 04.수집 2026. 06. 04.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.