실용적 조언
- RAG처럼 긴 문서를 자주 입력하는 워크로드라면 NPU 가속을 지원하는 lemonade나 OnnxRuntime 기반 도구를 사용하세요.
- iGPU에서 긴 컨텍스트를 처리할 때 TTFT가 너무 느리다면 양자화 비트를 무조건 낮추기보다 Q8 수준에서 테스트해보는 것이 유리할 수 있습니다.
섹션별 상세
$exe -m $model `
--prio 2 `
-c 24576 `
-t 4 `
-ngl 99 `
-b 1024 `
-ub 1024 `
-fa on `
-kvo `
--reasoning autoVulkan 백엔드를 사용하는 llama.cpp 서버의 실행 설정값이다.
용어 해설
- 첫 토큰 생성 시간(TTFT)
- — 입력 프롬프트가 제공된 후 모델이 첫 번째 토큰을 생성할 때까지 걸리는 시간이다. 대규모 컨텍스트를 처리하는 Prefill 단계의 효율성을 나타내며, RAG 시스템의 초기 응답 속도를 결정하는 핵심 지표이다.
- 초당 토큰 생성 수(TPS)
- — 모델이 첫 토큰 이후 텍스트를 생성하는 속도를 의미한다. 주로 Decode 단계의 성능을 나타내며, 실시간 챗봇의 가독 속도와 사용자 경험에 직접적인 영향을 미치는 수치이다.
- 신경망 처리 장치(NPU)
- — AI 연산에 최적화된 전용 하드웨어 가속기이다. CPU나 GPU보다 전력 효율이 높고 특정 행렬 연산에 특화되어 있어, 모바일이나 노트북 환경에서의 로컬 AI 추론 성능을 높이는 데 사용된다.
- 벌칸 API(Vulkan)
- — 고성능 그래픽 및 컴퓨팅을 위한 크로스 플랫폼 API이다. llama.cpp와 같은 도구에서 iGPU의 연산 자원을 활용하여 LLM 추론을 가속화하는 백엔드로 널리 사용된다.
- 프리필 단계(Prefill)
- — LLM 추론의 첫 단계로, 입력된 모든 프롬프트 토큰을 한꺼번에 처리하여 KV 캐시를 생성하는 과정이다. 컨텍스트가 길어질수록 연산량이 급증하며 TTFT에 가장 큰 영향을 미친다.
- 역양자화(Dequantization)
- — 메모리 절약을 위해 압축된 양자화 가중치를 실제 연산을 수행하기 위해 원래의 정밀도로 복원하는 과정이다. 연산 성능이 부족한 환경에서는 이 과정이 새로운 병목 현상을 일으킬 수 있다.
코드 예제
xrt-smi examine --report platform
// Platform Name : NPU Strix
// Power Mode : Turbo
// Total Columns : 8Ryzen AI 9 HX370 시스템에서 NPU 상태 및 플랫폼 정보를 확인하는 명령이다.
언급된 도구
Vulkan 백엔드를 통한 iGPU 가속 LLM 추론 엔진
OnnxRuntime GenAI를 활용한 NPU+iGPU 하이브리드 추론 도구
NPU 및 다양한 하드웨어 가속을 지원하는 추론 라이브러리
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.