본문으로 건너뛰기

초대형 언어 모델 실행을 위한 기반 구축: Cloudflare의 추론 최적화 기술

Cloudflare가 초대형 모델 추론을 위해 Infire 엔진 고도화, 프리필-디코드 분리, Mooncake 기반 KV 캐시 최적화를 적용하여 성능을 3배 향상시켰다.

섹션별 상세

LLM 추론의 프리필(입력 처리)과 디코드(출력 생성) 단계를 별도의 서버로 분리하여 하드웨어 활용도를 극대화했다. 프리필은 연산 집약적이고 디코드는 메모리 집약적이라는 특성에 맞춰 서버를 독립적으로 튜닝하고 부하를 분산한다. 이를 통해 p90 토큰 간 지연 시간이 약 100ms에서 20-30ms로 줄어드는 3배의 성능 향상을 달성했다.
근거
  • p90 토큰 간 지연 시간이 약 100ms에서 20-30ms로 개선되어 3배의 성능 향상을 보였다. Prefill decode (PD) disaggregation 섹션의 그래프 설명 및 수치
에이전트 서비스의 긴 문맥 처리를 위해 x-session-affinity 헤더를 활용한 프롬프트 캐싱을 최적화했다. 동일한 시스템 프롬프트나 도구 정의가 반복되는 요청을 특정 지역으로 라우팅하여 계산된 텐서를 재사용한다. 내부 주요 사용자들과 협력하여 캐시 히트율을 60%에서 80%로 끌어올렸으며, 이는 전체 처리량 증가와 비용 절감으로 이어졌다.
근거
  • 내부 사용자들의 입력 토큰 캐시 히트율이 피크 시간대 기준 60%에서 80%로 증가했다. Prompt Caching 섹션의 마지막 문단
Mooncake 전송 엔진과 저장소를 도입하여 여러 GPU 및 노드 간에 KV 캐시를 효율적으로 공유하는 구조를 구축했다. RDMA 프로토콜을 사용하여 CPU 개입 없이 GPU 메모리 간 데이터를 직접 전송하며, NVMe 저장소까지 캐시를 확장해 세션 유지 시간을 늘렸다. 이 방식은 클러스터 내 노드 간 캐시 재사용을 가능하게 하여 세션 인지 라우팅 의존도를 낮추고 부하 분산을 개선한다.
NVIDIA의 EAGLE-3 초안 모델을 활용한 투기적 디코딩을 적용하여 생성 속도를 높였다. 특히 에이전트의 도구 호출이나 JSON 구조와 같이 예측 가능한 출력 패턴에서 작은 모델이 먼저 토큰을 제안하고 큰 모델이 검증하는 방식이 효과적이다. 이를 통해 품질 저하 없이 초당 토큰 처리량(TPS)을 유의미하게 향상시켰다.
Rust로 작성된 독자 추론 엔진 Infire에 멀티 GPU 및 병렬 처리 지원을 추가하여 초대형 모델 구동 환경을 개선했다. 파이프라인 병렬화와 텐서 병렬화를 결합하고 활성화 함수 등의 메모리 점유를 최적화하여 vLLM보다 낮은 오버헤드를 구현했다. 1조 파라미터 규모의 Kimi K2.5를 8개의 H100 GPU에서 30GiB 이상의 여유 KV 캐시 공간을 확보하며 안정적으로 실행할 수 있다.
근거
  • Infire는 Kimi K2.5를 8개의 H100 GPU에서 실행하면서도 30GiB 이상의 KV 캐시용 VRAM을 확보한다. Even lower memory overhead 섹션

용어 해설

프리필-디코드 분리(Prefill-Decode Disaggregation)
LLM 추론의 두 단계인 입력 처리(Prefill)와 토큰 생성(Decode)을 서로 다른 서버에서 실행하는 기술이다. 프리필은 연산 중심이고 디코드는 메모리 대역폭 중심이라는 특성을 활용해 하드웨어 자원 효율을 극대화하고 지연 시간을 단축한다.
KV 캐시(KV Cache)
LLM 추론 과정에서 이전 토큰들의 Key와 Value 행렬을 저장해두는 메모리 영역이다. 매번 전체 문맥을 다시 계산하지 않고 저장된 값을 재사용함으로써 추론 속도를 높이고 연산 비용을 절감하는 핵심 메커니즘이다.
투기적 디코딩(Speculative Decoding)
작고 빠른 초안 모델이 여러 토큰을 먼저 예측하고 큰 타겟 모델이 이를 한 번에 검증하는 기법이다. 타겟 모델의 품질을 유지하면서도 한 번의 연산으로 여러 토큰을 확정할 수 있어 전체적인 생성 속도가 크게 향상된다.
원격 직접 메모리 접근(RDMA)
CPU를 거치지 않고 네트워크를 통해 한 컴퓨터의 메모리에서 다른 컴퓨터의 메모리로 데이터를 직접 전송하는 기술이다. 대규모 모델을 여러 GPU 노드에 분산 배치할 때 데이터 전송 지연을 최소화하는 데 필수적이다.

기술

  • Kimi K2.5
  • Infire
  • Mooncake Transfer Engine
  • EAGLE-3
  • Rust
  • H100 GPU
  • H200 GPU

활용 사례

  • AI 에이전트 서비스
  • 대규모 문서 요약
  • 실시간 AI 코드 리뷰
  • 복잡한 도구 호출(Tool Calling) 시스템

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 16.수집 2026. 04. 16.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.