본문으로 건너뛰기
AWS ML Blog조회 1

AWS, llm-d 기반의 LLM 분산 추론(Disaggregated Inference) 기능 발표

AWS는 llm-d와 협력하여 LLM 추론의 Prefill과 Decode 단계를 분리하고 EFA 고속 네트워크를 통해 처리량을 최대 70% 향상시키는 분산 추론 솔루션을 공개했다.

섹션별 상세

01
LLM 추론은 연산 집약적인 Prefill 단계와 메모리 대역폭 집약적인 Decode 단계로 나뉘며, 기존의 통합 방식은 자원 활용의 불균형을 초래한다. Prefill은 입력 프롬프트를 병렬로 처리하여 KV 캐시를 생성하고, Decode는 토큰을 하나씩 순차적으로 생성하며 지속적으로 메모리에 접근해야 하므로 두 단계의 하드웨어 요구 사항이 근본적으로 다르다.
02
llm-d는 Kubernetes 네이티브 프레임워크로서 Prefill과 Decode 서버를 분리하여 독립적으로 확장할 수 있는 분산 서빙 패턴을 제공한다. 이를 통해 사용자는 입력 시퀀스가 길면 Prefill 노드를 늘리고, 출력 토큰이 많으면 Decode 노드를 늘리는 방식으로 워크로드 특성에 맞춰 인프라를 유연하게 구성할 수 있다.
03
지능형 추론 스케줄러는 각 서빙 복제본의 KV 캐시 상태를 실시간으로 파악하여 요청을 최적의 노드로 라우팅한다. 멀티턴 대화나 에이전트 워크플로처럼 프롬프트 접두사(Prefix) 재사용이 많은 경우, 이미 해당 캐시를 보유한 노드로 요청을 보내 중복 연산을 방지하고 응답 속도를 높인다.
SageMaker HyperPod EKS 클러스터 내의 추론 요청 흐름도
Diagram사용자 요청이 로드 밸런서를 거쳐 인프런스 게이트웨이(Istio)로 전달되고, 엔드포인트 픽커가 최적의 Prefill 및 Decode 워커를 선택하여 요청을 할당하는 과정을 나타낸다. 노드 간 NIXL을 통한 KV 전송 메커니즘이 포함되어 있다.
04
AWS EFA와 NIXL(NVIDIA Inference Xfer Library)을 활용하여 분산된 노드 간에 RDMA 기반의 초고속 KV 캐시 전송을 구현했다. NIXL은 CPU를 거치지 않고 GPU 메모리 간 데이터를 직접 전송하는 추상화 계층을 제공하며, 이를 통해 Prefill 노드에서 생성된 캐시를 Decode 노드로 전송할 때 발생하는 지연 시간을 최소화했다.
bash
args:
  - "--block-size"
  - "128"
  - "--kv-transfer-config"
  - '{"kv_connector":"NixlConnector", "kv_role":"kv_both","kv_connector_extra_config": {"backends": ["LIBFABRIC"]}}'
  - "--max-model-len"
  - "32000"
// ...(중략)
resources:
  limits:
    vpc.amazonaws.com/efa: 4

vLLM 실행 시 NIXL 커넥터와 Libfabric 백엔드를 사용하여 EFA 기반의 KV 캐시 전송을 설정하는 예시

llm-d의 분산 서빙 통신 스택 다이어그램
DiagramvLLM과 NIXL이 UCX/Libfabric 및 EFA를 통해 EC2 노드 간에 점대점(Point-to-Point) KV 캐시 전송을 수행하는 계층 구조를 보여준다. Prefill과 Decode 단계가 물리적으로 분리된 노드에서 어떻게 고속 네트워크로 연결되는지 설명한다.
SageMaker HyperPod 관측성 대시보드 스크린샷
ScreenshotGPU 사용률, 텐서 코어 활용도, GPU 온도, EFA 네트워크 메트릭 등을 실시간으로 모니터링하는 화면이다. 분산 추론 환경에서 하드웨어 자원의 상태를 추적하고 최적화하는 데 사용됨을 보여준다.
05
MoE(Mixture-of-Experts) 모델을 위한 전문가 병렬 처리(Expert Parallelism)와 GPU 메모리 한계를 극복하는 계층형 프롬프트 캐싱 기능을 지원한다. 대규모 MoE 모델의 전문가들을 여러 노드에 분산 배치하여 처리량을 높이고, 자주 사용되지 않는 KV 캐시는 CPU 메모리나 디스크로 오프로딩하여 메모리 효율성을 극대화했다.

용어 해설

분산 추론(Disaggregated Inference)
LLM 추론 과정을 Prefill(입력 처리)과 Decode(토큰 생성) 단계로 물리적으로 분리하여 각각의 자원 요구 사항에 맞춰 독립적으로 확장하고 최적화하는 아키텍처이다. 이를 통해 GPU 자원 활용도를 극대화하고 대규모 워크로드의 처리량을 높인다.
KV 캐시(KV Cache)
LLM 추론 중 이전 토큰들의 Key와 Value 행렬을 저장하여 다음 토큰 생성 시 중복 계산을 방지하는 기술이다. 분산 추론 환경에서는 Prefill 노드에서 생성된 KV 캐시를 Decode 노드로 신속하게 전송하는 것이 성능의 핵심이다.
탄력적 패브릭 어댑터(EFA (Elastic Fabric Adapter))
AWS에서 제공하는 고성능 네트워크 인터페이스로, 노드 간 통신 지연 시간을 최소화하고 대역폭을 극대화한다. RDMA 기술을 지원하여 분산 추론 시 대용량 KV 캐시 데이터를 CPU 개입 없이 초고속으로 전송할 수 있게 한다.
원격 직접 메모리 액세스(RDMA (Remote Direct Memory Access))
운영 체제의 커널을 거치지 않고 한 컴퓨터의 메모리에서 다른 컴퓨터의 메모리로 데이터를 직접 전송하는 기술이다. CPU 부하를 줄이고 데이터 전송 지연 시간을 획기적으로 단축하여 고성능 컴퓨팅(HPC) 및 AI 추론에 필수적이다.
엔비디아 추론 전송 라이브러리(NIXL (NVIDIA Inference Xfer Library))
분산 추론 환경에서 노드 간 효율적인 점대점(Point-to-Point) 데이터 전송을 위해 설계된 라이브러리이다. GPU 메모리, CPU 메모리, 스토리지 간의 데이터 이동을 추상화하며 RDMA를 통한 고속 KV 캐시 공유를 지원한다.

기술

  • llm-d
  • vLLM
  • NIXL
  • AWS EFA
  • Amazon EKS
  • Amazon SageMaker HyperPod
  • Istio

활용 사례

  • 대규모 에이전트 워크플로
  • 긴 컨텍스트를 사용하는 RAG 시스템
  • 멀티턴 대화형 챗봇 서비스
  • MoE 모델 서빙 최적화

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 17.수집 2026. 03. 17.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.