본문으로 건너뛰기

AWS LMI 컨테이너 업데이트: LMCache와 EAGLE로 LLM 추론 성능 극대화

AWS가 LMI 컨테이너에 LMCache와 EAGLE 기술을 도입하여 긴 컨텍스트 추론의 지연 시간을 최대 62% 줄이고 비용 효율성을 대폭 향상했다.

섹션별 상세

01
LMCache는 단순 접두사(prefix) 캐싱을 넘어 문서 내 반복되는 텍스트 청크 단위로 KV 캐시를 추출하고 저장한다. GPU 메모리뿐만 아니라 CPU RAM과 NVMe SSD를 활용하는 다단계 저장 아키텍처를 통해 수백만 토큰의 긴 컨텍스트도 효율적으로 처리하며, 내부 인덱스를 통해 토큰 시퀀스와 캐시된 항목을 지능적으로 매핑한다.
02
벤치마크 결과 CPU 오프로딩 적용 시 전체 요청 지연 시간은 2.18배(52.9s에서 24.2s로), TTFT는 2.65배(1.16s에서 0.43s로) 빨라졌다. 이러한 지연 시간 감소는 동일 인프라에서 두 배 이상의 요청을 처리할 수 있게 하여 결과적으로 요청당 계산 비용을 약 50% 절감하는 효과를 제공한다.
03
모델 크기에 따라 KV 캐시 메모리 요구량이 다르므로 최적의 캐싱 전략이 필요하다. Qwen 2.5-72B와 같은 대형 모델은 토큰당 320KB의 메모리를 사용하여 약 500K 토큰부터 CPU 오프로딩의 혜택을 크게 받는 반면, 1.5B급 소형 모델은 2.5M 이상의 극단적인 긴 컨텍스트에서 오프로딩이 효과적이다.
04
EAGLE(Extrapolation Algorithm for Greater Language-model Efficiency) 기술은 모델의 은닉층에서 직접 미래 토큰을 예측하여 초안 토큰을 생성한다. 기본 모델이 이를 병렬로 검증함으로써 출력 품질을 유지하면서도 전체 생성 지연 시간을 단축하며, 특히 고동시성 운영 환경과 추론 중심 모델에서 성능 이점이 크다.
05
LoRA 어댑터 호스팅에 '지연 로딩(Lazy Loading)' 방식을 도입하여 인프라 구성 시 어댑터 가용성을 즉각적으로 확보하고 첫 호출 시점에 가중치를 등록한다. 또한 어댑터별로 독립적인 입출력 전처리 및 결과 포맷터 스크립트를 지원하여 멀티테넌트 배포 환경에서 유연한 데이터 처리가 가능하다.
06
DeepSeek v3.2, Mistral Large 3, Qwen3-VL 등 최신 오픈소스 및 멀티모달 모델에 대한 지원이 확장되었다. 비전-언어 모델을 위해 FlashAttention ViT를 기본 백엔드로 설정하고, 멀티스텝 CUDA 그래프 지원을 통해 시각 정보가 포함된 워크로드의 추론 속도를 최적화했다.
properties
option.lmcache_config_file=/path/to/your/lmcache_config.yaml
# 또는 환경 변수 사용
OPTION_LMCACHE_CONFIG_FILE=/path/to/your/lmcache_config.yaml

LMCache를 수동으로 설정하기 위해 설정 파일 경로를 지정하는 예시

properties
option.lmcache_auto_config=True
# 또는 환경 변수 사용
OPTION_LMCACHE_AUTO_CONFIG=True

호스트의 자원을 자동으로 감지하여 LMCache를 활성화하는 자동 설정 예시

용어 해설

키-값 캐시(KV Cache)
LLM 추론 과정에서 이전 토큰들의 Attention 연산 결과를 저장해두는 기술이다. 매번 처음부터 다시 계산하지 않게 하여 추론 속도를 높이지만, 컨텍스트가 길어질수록 막대한 GPU 메모리를 점유하는 특성이 있다.
첫 토큰 생성 시간(TTFT)
사용자의 입력 후 모델이 첫 번째 토큰을 출력할 때까지 걸리는 지연 시간이다. 실시간 챗봇이나 대화형 AI 서비스에서 사용자가 체감하는 응답 속도를 결정하는 가장 중요한 성능 지표 중 하나이다.
투측 디코딩(Speculative Decoding)
가벼운 드래프트 모델이 다음 토큰들을 미리 예측하고, 메인 모델이 이를 한 번에 검증하는 방식이다. 모델의 정확도를 유지하면서도 순차적인 토큰 생성 과정을 병렬화하여 전체 추론 속도를 향상시킨다.
LoRA 어댑터(LoRA Adapter)
거대 모델 전체를 재학습하는 대신, 저순위 행렬만을 추가하여 특정 작업에 맞게 미세 조정된 작은 파라미터 모듈이다. 기본 모델 하나에 여러 어댑터를 교체하며 사용할 수 있어 멀티테넌트 서비스에 효율적이다.
스티키 라우팅(Sticky Routing)
동일한 세션이나 사용자의 요청을 이전에 처리했던 특정 서버 인스턴스로 계속 전달하는 네트워크 기술이다. 로컬 캐시에 저장된 데이터를 재사용할 확률을 높여 캐시 적중률과 성능을 극대화한다.

기술

  • AWS LMI
  • LMCache
  • EAGLE
  • Qwen 2.5
  • DeepSeek v3.2
  • NVMe O_DIRECT

활용 사례

  • 대규모 문서 기반 RAG 시스템
  • 긴 대화 이력을 유지하는 챗봇
  • 코드 베이스 전체를 참조하는 코딩 에이전트
  • 멀티테넌트 LoRA 어댑터 서비스
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 27.수집 2026. 03. 01.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.