이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
Cloudflare는 Workers AI에서 긴 컨텍스트 LLM을 더 많은 동시 요청으로 서비스하기 위해 KV 캐시를 FP8(e4m3)로 양자화하고 가중치를 INT4로 압축하며 캐시 보호 전략을 도입했습니다. Kimi K2.6에서는 BF16 대비 FP8로 캐시 용량이 두 배가 되었고 동시성 증가로 최대 처리량과 비용 효율이 개선되었습니다. GLM 5.2 가중치는 INT4로 압축해 체크포인트와 GPU당 메모리를 크게 줄였고, 모든 변경은 평가 스위트에서 정확도 열화 없이 검증되었습니다.
섹션별 상세
긴 컨텍스트 LLM을 엣지 데이터센터에서 효율적으로 제공하려면 GPU 메모리 관리가 핵심 과제입니다. Cloudflare는 Workers AI에서 Kimi K-series와 Z.ai의 GLM 같은 긴 컨텍스트·Mixture-of-Experts 모델을 서비스하면서 KV 캐시와 모델 가중치가 메모리를 주로 소비하는 관찰을 바탕으로 최적화 계층을 적용했습니다. 이를 통해 더 많은 동시 요청을 동일 하드웨어에서 수용하고 비용을 낮추는 것을 목표로 삼았습니다.
KV 캐시를 FP8(e4m3)로 양자화하면 단위 토큰당 약간의 추가 연산이 발생하지만 캐시 크기를 절반으로 줄여 한 GPU에 상주시키는 동시 요청 수를 늘립니다. Cloudflare 측 측정에서 Kimi K2.6의 컨텍스트 저장량이 BF16 기준 약 686,000토큰에서 FP8로는 약 1.37백만 토큰으로 두 배가 되었고, 단일 동시성 구간에서 BF16은 처리량이 약간 빠르지만 32 동시 요청에서 캐시가 포화되는 반면 FP8은 64까지 확장되어 초당 토큰 처리량과 비용 효율에서 우위를 보였습니다. 프리필(prefill) 단계는 계산 바운드이므로 BF16을 유지하고 디코드 단계에서 FP8을 활용하는 식으로 단계별로 포맷을 달리해 최적의 처리량과 메모리 수용을 조합했습니다.
근거
- Kimi K2.6에서 KV 캐시를 BF16에서 FP8으로 바꾸면 컨텍스트 용량이 약 686,000토큰에서 약 1.37백만 토큰으로 두 배가 된다. — Quantizing the KV cache 섹션의 Kimi K2.6 예시 수치
- BF16은 단일 토큰 처리에서 약간 더 빠르지만 BF16은 캐시 포화로 32 동시 요청에서 멈추는 반면 FP8은 64 동시 요청까지 확장되어 최대 처리량이 약 41% 높고 토큰당 비용은 약 30% 낮아진다. — Quantizing the KV cache 섹션의 동시성별 처리량·비용 비교 표 요약
모델 가중치는 INT4 양자화로 8비트 대비 추가 압축을 적용해 메모리 여유를 확보했습니다. GLM 5.2의 체크포인트를 8비트 부동소수점에서 INT4 정수로 변환하자 원본 705GB가 421GB로 약 40% 축소되었고, 8-way 텐서 병렬 배포에서 GPU당 메모리가 약 88GB에서 52GB로 감소해 동일 하드웨어에서 약 1.18백만 토큰의 KV 캐시를 수용할 공간이 생겼습니다. 평가 스위트에서 INT4와 FP8 가중치 간의 정확도 차이는 관찰되지 않아 메모리 절약이 실무적 이득으로 연결된 점이 근거로 제시됩니다.
근거
- GLM 5.2의 가중치를 INT4로 압축하면 체크포인트가 705GB에서 421GB로 약 40% 줄고, 8-way 텐서 병렬 환경에서 GPU당 메모리가 약 88GB에서 52GB로 낮아져 약 1.18백만 토큰의 KV 캐시 여유가 생긴다. — Compressing the model weights 섹션의 GLM 5.2 압축 결과 수치
이러한 메모리 절감 조치들이 같은 하드웨어에서 더 많은 요청을 밀집시키기 때문에 캐시 보호와 동시성 제어가 중요해집니다. Cloudflare는 프리필과 디코드의 분리, FP8 캐시 사용, INT4 가중치 압축을 조합해 전반적인 비용 대비 성능을 개선하면서도 모델 응답 품질에 영향이 없음을 확인했습니다. 모든 실험과 프로덕션 트래픽은 SGLang 오픈소스 추론 프레임워크에서 벤치마크되었고, Cloudflare는 해당 프로젝트와 패치를 협력해 공유하고 있습니다.
용어 해설
- KV 캐시(KV cache)
- — 모델이 생성 과정에서 각 토큰의 attention key와 value를 저장하는 메모리 버퍼로, 긴 컨텍스트를 재처리 없이 유지하게 해주며 대부분의 긴-컨텍스트 추론 환경에서 GPU 메모리를 가장 먼저 차지합니다.
- FP8(e4m3)(FP8 (e4m3))
- — 8비트 부동소수점 표현 방식 중 하나로 지수 4비트·가수 3비트를 사용하여 메모리와 대역폭을 절감하면서도 실시간 추론에서 허용 가능한 정밀도를 유지해 여러 동시 요청을 더 많이 메모리에 유지할 수 있게 합니다.
- BF16
- — 두 배 정밀도에 해당하는 16비트 부동소수점 포맷으로, 많은 모델에서 기본적으로 사용되며 단일 토큰 처리 속도는 FP8보다 조금 더 높지만 메모리 요구량이 커져 동시 처리 가능한 요청 수가 제한됩니다.
- INT4 양자화(INT4 quantization)
- — 모델 가중치를 4비트 정수로 압축하는 기법으로, 체크포인트와 GPU 상의 메모리 점유를 크게 줄여 동일 하드웨어에서 더 큰 KV 캐시를 유지하거나 더 많은 모델을 배치할 수 있도록 합니다.
- H200 GPU(H200)
- — Cloudflare가 사용한 분산 추론 배포의 하드웨어로, 대규모 모델의 텐서 병렬 및 KV 캐시 요구를 충족시키는 목적에서 사용되며 메모리 최적화와 연산 분리 전략의 기준점이 됩니다.
기술
- FP8 (e4m3)
- BF16
- INT4
- H200
- SGLang
- Workers AI
활용 사례
- 긴 컨텍스트를 요구하는 대화형 LLM을 엣지 데이터센터에서 비용 효율적으로 서비스하는 경우
- 대규모 모델을 동일 하드웨어에서 더 많은 동시 요청으로 운영해 인프라 비용을 낮추는 경우
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 08. 03.수집 2026. 08. 03.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.