본문으로 건너뛰기
r/LocalLLaMA조회 1

iGPU vs NPU: 긴 컨텍스트 환경에서의 llama.cpp와 lemonade 성능 비교

Ryzen AI 9 HX370 환경에서 NPU는 긴 컨텍스트의 초기 응답(TTFT)에서 압도적이나, 생성 속도(TPS)는 iGPU 기반 llama.cpp가 우세하다.

실용적 조언

  • RAG처럼 긴 문서를 자주 입력하는 워크로드라면 NPU 가속을 지원하는 lemonade나 OnnxRuntime 기반 도구를 사용하세요.
  • iGPU에서 긴 컨텍스트를 처리할 때 TTFT가 너무 느리다면 양자화 비트를 무조건 낮추기보다 Q8 수준에서 테스트해보는 것이 유리할 수 있습니다.

섹션별 상세

01
NPU와 iGPU의 TTFT 성능 차이가 긴 컨텍스트에서 극명하게 나타났다. 약 18,000 토큰의 입력을 처리할 때 lemonade 하이브리드 모드는 Qwen3 4B 모델 기준 4.5초의 TTFT를 기록하며 llama.cpp Vulkan(66~67초) 대비 약 15배 빠른 속도를 보였다. 이는 대규모 문서를 반복적으로 주입하는 RAG 워크플로우에서 NPU가 초기 대기 시간을 획기적으로 줄여줌을 의미한다.
bash
$exe -m $model `
  --prio 2 `
  -c 24576 `
  -t 4 `
  -ngl 99 `
  -b 1024 `
  -ub 1024 `
  -fa on `
  -kvo `
  --reasoning auto

Vulkan 백엔드를 사용하는 llama.cpp 서버의 실행 설정값이다.

02
텍스트 생성 속도인 TPS 측면에서는 llama.cpp Vulkan 백엔드가 여전히 우위를 점했다. lfm 1.2B 모델 테스트에서 llama.cpp(Q4_K_M)는 73.8 TPS를 달성했으나 NPU는 37.0 TPS에 그쳐 약 2배의 성능 차이가 확인됐다. 실시간 대화나 창의적 글쓰기처럼 빠른 문장 생성이 중요한 작업에는 iGPU 최적화가 더 적합하다는 결론에 도달했다.
03
양자화 수준에 따른 TTFT의 역설적 현상이 관찰됐다. lfm 1.2B 모델에서 Q4_K_M 양자화 버전이 Q8_0보다 오히려 TTFT가 느리게 측정되는 결과가 나왔다. 이는 iGPU의 연산 성능이 병목인 상황에서 압축된 가중치를 복원하는 역양자화(Dequantization) 오버헤드가 메모리 대역폭 절감 효과를 상쇄했기 때문으로 분석됐다.
04
프레임워크 간의 커널 최적화 성숙도가 전체 성능에 큰 영향을 미쳤다. llama.cpp의 Vulkan 커널은 고도로 최적화되어 높은 TPS를 유지하는 반면, OnnxRuntime GenAI 기반의 lemonade는 상대적으로 최적화가 부족하여 하이브리드 모드임에도 생성 속도가 낮게 나타났다. 또한 lemonade가 사용하는 특정 양자화 방식(W4A16 추정)에 따른 모델 크기 차이도 성능 변수로 작용했다.

용어 해설

첫 토큰 생성 시간(TTFT)
입력 프롬프트가 제공된 후 모델이 첫 번째 토큰을 생성할 때까지 걸리는 시간이다. 대규모 컨텍스트를 처리하는 Prefill 단계의 효율성을 나타내며, RAG 시스템의 초기 응답 속도를 결정하는 핵심 지표이다.
초당 토큰 생성 수(TPS)
모델이 첫 토큰 이후 텍스트를 생성하는 속도를 의미한다. 주로 Decode 단계의 성능을 나타내며, 실시간 챗봇의 가독 속도와 사용자 경험에 직접적인 영향을 미치는 수치이다.
신경망 처리 장치(NPU)
AI 연산에 최적화된 전용 하드웨어 가속기이다. CPU나 GPU보다 전력 효율이 높고 특정 행렬 연산에 특화되어 있어, 모바일이나 노트북 환경에서의 로컬 AI 추론 성능을 높이는 데 사용된다.
벌칸 API(Vulkan)
고성능 그래픽 및 컴퓨팅을 위한 크로스 플랫폼 API이다. llama.cpp와 같은 도구에서 iGPU의 연산 자원을 활용하여 LLM 추론을 가속화하는 백엔드로 널리 사용된다.
프리필 단계(Prefill)
LLM 추론의 첫 단계로, 입력된 모든 프롬프트 토큰을 한꺼번에 처리하여 KV 캐시를 생성하는 과정이다. 컨텍스트가 길어질수록 연산량이 급증하며 TTFT에 가장 큰 영향을 미친다.
역양자화(Dequantization)
메모리 절약을 위해 압축된 양자화 가중치를 실제 연산을 수행하기 위해 원래의 정밀도로 복원하는 과정이다. 연산 성능이 부족한 환경에서는 이 과정이 새로운 병목 현상을 일으킬 수 있다.

코드 예제

bash
xrt-smi examine --report platform
// Platform Name : NPU Strix
// Power Mode : Turbo
// Total Columns : 8

Ryzen AI 9 HX370 시스템에서 NPU 상태 및 플랫폼 정보를 확인하는 명령이다.

언급된 도구

llama.cpp추천

Vulkan 백엔드를 통한 iGPU 가속 LLM 추론 엔진

lemonade추천

OnnxRuntime GenAI를 활용한 NPU+iGPU 하이브리드 추론 도구

OnnxRuntime GenAI중립

NPU 및 다양한 하드웨어 가속을 지원하는 추론 라이브러리

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 31.수집 2026. 04. 01.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.