섹션별 상세
llmtop은 vLLM, SGLang, TensorRT-LLM 등 10개 이상의 다양한 LLM 추론 백엔드를 지원하며 각 엔진의 고유한 메트릭 접두사를 자동으로 감지한다.
bash
brew install InfraWhisperer/tap/llmtop
# 또는
go install github.com/InfraWhisperer/llmtop/cmd/llmtop@latestHomebrew 또는 Go를 이용한 llmtop 설치 방법

실시간 모니터링 지표에는 KV 캐시 점유율, 요청 큐 깊이, 첫 번째 토큰 생성 시간(TTFT), 토큰 간 지연 시간(ITL), 그리고 전체 토큰 처리량이 포함된다.
Kubernetes 네이티브 설계를 통해 API 서버 프록시를 사용하여 추론 포드를 자동 검색하며, 특정 네임스페이스 지정이나 직접 엔드포인트 연결도 지원한다.
bash
# Kubernetes — API 서버 프록시를 통한 자동 검색
llmtop
# 특정 네임스페이스 지정
llmtop -n inference
# 직접 엔드포인트 연결
llmtop -e http://10.0.0.1:8000 -e http://10.0.0.2:8000Kubernetes 환경 및 직접 엔드포인트 지정을 통한 실행 예시
GPU 리소스 뷰를 통해 DCGM 익스포터 기반의 GPU 사용률, VRAM 점유, 온도, 전력 소비량을 실시간으로 확인할 수 있다.
모델 그룹화 기능을 제공하여 여러 워커에 분산된 동일 모델의 통계를 합산해서 보여주며, 상세 뷰를 통해 개별 노드의 상태로 드릴다운이 가능하다.
용어 해설
- KV 캐시(KV Cache)
- — LLM 추론 과정에서 이전 토큰들의 Key와 Value 계산 값을 메모리에 저장해두는 기법이다. 재계산을 방지하여 추론 속도를 높이지만 메모리 점유율이 높아 관리가 필수적이다.
- 첫 번째 토큰 생성 시간(TTFT)
- — Time To First Token의 약자로, 사용자의 입력이 들어온 후 모델이 첫 번째 응답 토큰을 내놓을 때까지 걸리는 시간이다. 실시간 대화형 서비스의 사용자 경험을 결정하는 핵심 지표이다.
- 토큰 간 지연 시간(ITL)
- — Inter-Token Latency의 약자로, 생성 과정 중 각 토큰 사이의 시간 간격을 의미한다. 텍스트가 얼마나 매끄럽고 빠르게 출력되는지를 나타내는 성능 지표이다.
- DCGM 익스포터(DCGM Exporter)
- — NVIDIA GPU의 하드웨어 상태(사용률, 온도, 전력 등)를 수집하여 모니터링 시스템에 전달하는 도구이다. 클러스터 환경에서 GPU 자원 효율성을 파악하는 데 사용된다.
기술
- Go
- vLLM
- SGLang
- NVIDIA NIM
- TensorRT-LLM
- Kubernetes
- DCGM
활용 사례
- LLM 추론 클러스터 실시간 병목 진단
- KV 캐시 포화 상태 모니터링
- 모델별 추론 성능 비교 및 집계
- GPU 자원 사용량 실시간 추적
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 18.수집 2026. 03. 18.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.