섹션별 상세

args:
- "--block-size"
- "128"
- "--kv-transfer-config"
- '{"kv_connector":"NixlConnector", "kv_role":"kv_both","kv_connector_extra_config": {"backends": ["LIBFABRIC"]}}'
- "--max-model-len"
- "32000"
// ...(중략)
resources:
limits:
vpc.amazonaws.com/efa: 4vLLM 실행 시 NIXL 커넥터와 Libfabric 백엔드를 사용하여 EFA 기반의 KV 캐시 전송을 설정하는 예시


용어 해설
- 분산 추론(Disaggregated Inference)
- — LLM 추론 과정을 Prefill(입력 처리)과 Decode(토큰 생성) 단계로 물리적으로 분리하여 각각의 자원 요구 사항에 맞춰 독립적으로 확장하고 최적화하는 아키텍처이다. 이를 통해 GPU 자원 활용도를 극대화하고 대규모 워크로드의 처리량을 높인다.
- KV 캐시(KV Cache)
- — LLM 추론 중 이전 토큰들의 Key와 Value 행렬을 저장하여 다음 토큰 생성 시 중복 계산을 방지하는 기술이다. 분산 추론 환경에서는 Prefill 노드에서 생성된 KV 캐시를 Decode 노드로 신속하게 전송하는 것이 성능의 핵심이다.
- 탄력적 패브릭 어댑터(EFA (Elastic Fabric Adapter))
- — AWS에서 제공하는 고성능 네트워크 인터페이스로, 노드 간 통신 지연 시간을 최소화하고 대역폭을 극대화한다. RDMA 기술을 지원하여 분산 추론 시 대용량 KV 캐시 데이터를 CPU 개입 없이 초고속으로 전송할 수 있게 한다.
- 원격 직접 메모리 액세스(RDMA (Remote Direct Memory Access))
- — 운영 체제의 커널을 거치지 않고 한 컴퓨터의 메모리에서 다른 컴퓨터의 메모리로 데이터를 직접 전송하는 기술이다. CPU 부하를 줄이고 데이터 전송 지연 시간을 획기적으로 단축하여 고성능 컴퓨팅(HPC) 및 AI 추론에 필수적이다.
- 엔비디아 추론 전송 라이브러리(NIXL (NVIDIA Inference Xfer Library))
- — 분산 추론 환경에서 노드 간 효율적인 점대점(Point-to-Point) 데이터 전송을 위해 설계된 라이브러리이다. GPU 메모리, CPU 메모리, 스토리지 간의 데이터 이동을 추상화하며 RDMA를 통한 고속 KV 캐시 공유를 지원한다.
기술
- llm-d
- vLLM
- NIXL
- AWS EFA
- Amazon EKS
- Amazon SageMaker HyperPod
- Istio
활용 사례
- 대규모 에이전트 워크플로
- 긴 컨텍스트를 사용하는 RAG 시스템
- 멀티턴 대화형 챗봇 서비스
- MoE 모델 서빙 최적화
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

