TL;DR
대규모 GPU 추론은 HBM에 있는 모델 가중치와 KV Cache를 새 토큰마다 반복해서 읽기 때문에 높은 전력과 발열, liquid cooling 설비를 요구합니다. d-Matrix의 접근은 PCIe 기반 air-cooled accelerator에 SRAM을 배치해 memory-bound 작업을 GPU에서 분리하고, GPU에는 compute-heavy 작업을 남기는 방식입니다. Speculative decoding은 작은 모델의 토큰 추측을 SRAM에서 처리한 뒤 GPU가 묶음 단위로 검증하고, Attention-FFN disaggregation은 FFN을 SRAM 가속기로 옮겨 Attention과 분리합니다. 이 구조는 새 liquid-cooled 랙을 수년에 걸쳐 구축하는 대신 기존 서버의 빈 PCIe 슬롯을 활용해 전력·열 용량 안에서 추론 처리량을 확장하려는 선택지입니다.
섹션별 상세

- PCIe 기반 air-cooled accelerator는 기존 GPU와 함께 기존 데이터센터에서 liquid cooling 시스템 증설 없이 운용할 수 있습니다. — 도입부의 PCIe 기반 가속기와 air cooling 설명 및 기존 데이터센터 병행 운용 문단 출처
- GPU 추론 디코딩은 새 토큰마다 HBM에 저장된 모델 가중치와 KV Cache를 반복적으로 읽어 에너지와 열을 발생시킵니다. — Where the weights live is where things run hot 섹션의 HBM 왕복 접근 설명
- SRAM에 가중치와 KV Cache를 배치하면 데이터 접근 거리가 짧아져 접근 에너지와 전체 발열을 줄일 수 있습니다. — SRAM 기반 memory-optimized accelerator의 온칩 저장과 물리적 거리 단축을 설명한 문단
- Speculative decoding은 SRAM에서 작은 모델이 다음 토큰을 추측하고 GPU가 큰 배치로 결과를 검증하는 방식입니다. — How air cooled AI accelerators change the perf/TCO calculus 섹션의 speculative decoding 설명
- Attention-FFN disaggregation은 FFN을 SRAM 기반 가속기로 옮기고 Attention 처리를 GPU에 남깁니다. — Attention-FFN disaggregation의 역할 분리를 설명한 문단
- Air-cooled inference의 활용 범위는 수백 개 시설에 한정된 liquid-cooled inference보다 넓어 팬이 있는 모든 서버실과 수백만 개 랙으로 확장됩니다. — 도입부의 liquid-cooled inference와 air-cooled inference addressable world 비교 및 마지막 문단 출처
용어 해설
- 분리형 AI 추론(Disaggregated AI Inference)
- — 추론 파이프라인의 작업을 하나의 GPU에 몰아넣지 않고, 연산량이 큰 부분과 메모리 접근이 잦은 부분을 서로 다른 가속기에 배치하는 구조입니다. GPU는 compute-heavy 작업을 맡고 SRAM 기반 가속기는 memory-bound 작업을 처리해 기존 전력·열 용량 안에서 처리량을 높이는 방식입니다.
- KV Cache
- — 생성형 모델이 이전 토큰의 Key와 Value를 저장해 다음 토큰 생성 때 재사용하는 메모리 영역입니다. 디코딩 과정에서는 모델 가중치와 함께 반복적으로 읽히므로 저장 위치와 메모리 대역폭이 지연시간, 전력 소모, 발열에 직접 영향을 줍니다.
- SRAM
- — 가속기 칩에 가까운 위치에서 데이터를 저장하고 읽는 정적 메모리입니다. 이 글에서는 모델 가중치와 KV Cache를 온칩 SRAM에 배치해 데이터 이동 거리를 줄이고, HBM을 반복적으로 왕복하는 GPU 추론보다 접근 에너지와 발열을 낮추는 기반으로 활용합니다.
- Speculative Decoding
- — 작고 효율적인 모델이 다음 토큰을 먼저 추측하고, GPU의 큰 모델이 여러 토큰을 묶어 검증하는 추론 기법입니다. 작은 모델을 SRAM에서 실행하면 GPU가 토큰을 하나씩 순차 생성하는 부담을 줄여 기존 GPU의 연산 자원을 더 효율적으로 사용할 수 있습니다.
- Attention-FFN 분리(Attention-FFN Disaggregation)
- — KV Cache가 계속 커지는 Attention 처리와 크기가 고정된 Feed-Forward Network 처리를 서로 다른 하드웨어에 배치하는 구조입니다. FFN을 SRAM 기반 가속기로 옮기고 Attention을 GPU에 남겨 메모리 특성이 다른 작업을 각각 적합한 장치에서 처리합니다.
- HBM
- — GPU에 연결된 고대역폭 메모리로, 전통적인 GPU 추론에서는 모델 가중치와 KV Cache를 저장하는 장소입니다. 디코딩 때마다 이 데이터를 반복해서 읽어야 하므로 더 많은 HBM 대역폭을 확보하려면 GPU와 전력, 냉각 설비를 함께 늘려야 하는 부담이 생깁니다.
기술
- PCIe
- GPU
- HBM
- KV Cache
- SRAM
- liquid cooling
- air cooling
- speculative decoding
- Attention-FFN disaggregation
활용 사례
- low-latency generative AI inference
- agentic pipeline
- frontier model inference
- 기존 GPU 데이터센터의 추론 처리량 확장
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.