본문으로 건너뛰기

분리형 AI 추론으로 발열과 냉각 비용 줄이기

SRAM 기반 air-cooled accelerator가 GPU 추론의 메모리 병목과 냉각 부담을 낮추는 구조를 제시합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

대규모 GPU 추론은 HBM에 있는 모델 가중치와 KV Cache를 새 토큰마다 반복해서 읽기 때문에 높은 전력과 발열, liquid cooling 설비를 요구합니다. d-Matrix의 접근은 PCIe 기반 air-cooled accelerator에 SRAM을 배치해 memory-bound 작업을 GPU에서 분리하고, GPU에는 compute-heavy 작업을 남기는 방식입니다. Speculative decoding은 작은 모델의 토큰 추측을 SRAM에서 처리한 뒤 GPU가 묶음 단위로 검증하고, Attention-FFN disaggregation은 FFN을 SRAM 가속기로 옮겨 Attention과 분리합니다. 이 구조는 새 liquid-cooled 랙을 수년에 걸쳐 구축하는 대신 기존 서버의 빈 PCIe 슬롯을 활용해 전력·열 용량 안에서 추론 처리량을 확장하려는 선택지입니다.

섹션별 상세

대규모 GPU 데이터센터는 카드 한 장이 1kW를 넘는 전력을 소비하고 랙 전체가 수백 kW에 이르면서 liquid cooling 설비를 필요로 합니다. 그러나 low-latency 추론에서는 GPU가 HBM을 반복해서 오가는 동안 전체 연산 능력을 쓰지 못해 유휴 자원이 생깁니다. 글은 PCIe 기반 air-cooled accelerator를 기존 서버의 빈 슬롯에 추가해 memory-bound 작업을 분리하면 새 liquid-cooled 랙 없이 기존 전력·열 용량 안에서 처리량을 키울 수 있다고 설명합니다.
Air-cooled accelerator와 liquid-cooled GPU를 추가할 때 전력 증가에 따른 총 처리량 변화를 비교한 선형 차트입니다.
Chart차트의 빨간 선은 300–600W급 air-cooled accelerator를 추가할 때 기존 랙의 GPU를 보강해 처리량이 더 가파르게 증가하는 흐름을 나타냅니다. 회색 점선은 1,000W 이상 liquid-cooled GPU를 +1, +2, +3으로 추가하는 경우를 나타내며, 같은 power budget에서 air-cooled 방식이 더 높은 throughput을 목표로 한다는 글의 핵심 비교와 연결됩니다.
근거
  • PCIe 기반 air-cooled accelerator는 기존 GPU와 함께 기존 데이터센터에서 liquid cooling 시스템 증설 없이 운용할 수 있습니다. 도입부의 PCIe 기반 가속기와 air cooling 설명 및 기존 데이터센터 병행 운용 문단 출처
GPU 추론 디코딩은 모델 가중치와 KV Cache가 있는 HBM을 새 토큰마다 반복해서 읽는 방식이라 데이터 왕복 거리와 접근 에너지가 커집니다. GPU만 사용할 때 지연시간을 낮추려면 aggregate HBM bandwidth를 늘려야 하고, 이는 GPU 수와 전력·발열·냉각 부담을 함께 키웁니다. SRAM 기반 memory-optimized accelerator는 가중치와 KV Cache를 칩 안에 가깝게 두어 이동 거리를 줄이고, 더 짧은 메모리 접근으로 연산 자원을 효율적으로 채웁니다.
근거
  • GPU 추론 디코딩은 새 토큰마다 HBM에 저장된 모델 가중치와 KV Cache를 반복적으로 읽어 에너지와 열을 발생시킵니다. Where the weights live is where things run hot 섹션의 HBM 왕복 접근 설명
  • SRAM에 가중치와 KV Cache를 배치하면 데이터 접근 거리가 짧아져 접근 에너지와 전체 발열을 줄일 수 있습니다. SRAM 기반 memory-optimized accelerator의 온칩 저장과 물리적 거리 단축을 설명한 문단
air-cooled 시스템은 단순한 agentic pipeline 단계뿐 아니라 기존 GPU와 결합한 frontier model 추론에도 사용할 수 있습니다. Speculative decoding에서는 SRAM에서 작은 모델이 다음 토큰을 추측하고 GPU가 여러 토큰을 한꺼번에 검증하며, Attention-FFN disaggregation에서는 KV Cache를 처리하는 Attention을 GPU에 남기고 고정 크기의 FFN을 SRAM 기반 가속기로 옮깁니다. 두 방식 모두 새 GPU를 계속 추가하는 대신 이미 연결된 GPU의 순차적 디코딩 부담을 분산해 같은 전력 예산에서 더 많은 추론 작업을 처리하려는 접근입니다.
근거
  • Speculative decoding은 SRAM에서 작은 모델이 다음 토큰을 추측하고 GPU가 큰 배치로 결과를 검증하는 방식입니다. How air cooled AI accelerators change the perf/TCO calculus 섹션의 speculative decoding 설명
  • Attention-FFN disaggregation은 FFN을 SRAM 기반 가속기로 옮기고 Attention 처리를 GPU에 남깁니다. Attention-FFN disaggregation의 역할 분리를 설명한 문단
새 GPU를 liquid-cooled 랙에 배치하려면 건물 냉각 용량과 전력 설비를 함께 늘려야 하며 구축 기간도 수개월이 아니라 수년에 걸릴 수 있습니다. 반면 기존 cloud computing 세대의 데이터센터에는 PCIe 기반 lower-density 랙과 빈 슬롯이 남아 있어 별도의 냉각 설비 증설 없이 SRAM 기반 가속기를 추가할 여지가 있습니다. 따라서 글은 수백 곳에 그치는 liquid-cooled inference 환경보다 팬이 설치된 수백만 개 랙을 활용하는 air-cooled inference가 확장성과 총소유비용 측면에서 더 넓은 선택지를 제공한다고 결론짓습니다.
근거
  • Air-cooled inference의 활용 범위는 수백 개 시설에 한정된 liquid-cooled inference보다 넓어 팬이 있는 모든 서버실과 수백만 개 랙으로 확장됩니다. 도입부의 liquid-cooled inference와 air-cooled inference addressable world 비교 및 마지막 문단 출처

용어 해설

분리형 AI 추론(Disaggregated AI Inference)
추론 파이프라인의 작업을 하나의 GPU에 몰아넣지 않고, 연산량이 큰 부분과 메모리 접근이 잦은 부분을 서로 다른 가속기에 배치하는 구조입니다. GPU는 compute-heavy 작업을 맡고 SRAM 기반 가속기는 memory-bound 작업을 처리해 기존 전력·열 용량 안에서 처리량을 높이는 방식입니다.
KV Cache
생성형 모델이 이전 토큰의 Key와 Value를 저장해 다음 토큰 생성 때 재사용하는 메모리 영역입니다. 디코딩 과정에서는 모델 가중치와 함께 반복적으로 읽히므로 저장 위치와 메모리 대역폭이 지연시간, 전력 소모, 발열에 직접 영향을 줍니다.
SRAM
가속기 칩에 가까운 위치에서 데이터를 저장하고 읽는 정적 메모리입니다. 이 글에서는 모델 가중치와 KV Cache를 온칩 SRAM에 배치해 데이터 이동 거리를 줄이고, HBM을 반복적으로 왕복하는 GPU 추론보다 접근 에너지와 발열을 낮추는 기반으로 활용합니다.
Speculative Decoding
작고 효율적인 모델이 다음 토큰을 먼저 추측하고, GPU의 큰 모델이 여러 토큰을 묶어 검증하는 추론 기법입니다. 작은 모델을 SRAM에서 실행하면 GPU가 토큰을 하나씩 순차 생성하는 부담을 줄여 기존 GPU의 연산 자원을 더 효율적으로 사용할 수 있습니다.
Attention-FFN 분리(Attention-FFN Disaggregation)
KV Cache가 계속 커지는 Attention 처리와 크기가 고정된 Feed-Forward Network 처리를 서로 다른 하드웨어에 배치하는 구조입니다. FFN을 SRAM 기반 가속기로 옮기고 Attention을 GPU에 남겨 메모리 특성이 다른 작업을 각각 적합한 장치에서 처리합니다.
HBM
GPU에 연결된 고대역폭 메모리로, 전통적인 GPU 추론에서는 모델 가중치와 KV Cache를 저장하는 장소입니다. 디코딩 때마다 이 데이터를 반복해서 읽어야 하므로 더 많은 HBM 대역폭을 확보하려면 GPU와 전력, 냉각 설비를 함께 늘려야 하는 부담이 생깁니다.

기술

  • PCIe
  • GPU
  • HBM
  • KV Cache
  • SRAM
  • liquid cooling
  • air cooling
  • speculative decoding
  • Attention-FFN disaggregation

활용 사례

  • low-latency generative AI inference
  • agentic pipeline
  • frontier model inference
  • 기존 GPU 데이터센터의 추론 처리량 확장
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 13.수집 2026. 08. 13.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.