TL;DR
에이전트가 추론 과정에서 도구를 호출하고 여러 단계를 이어가면서 생성 토큰이 늘어나자, 추론 성능의 중심 병목이 peak compute에서 memory-bound decode로 이동하고 있다. SambaNova가 분석한 6개 frontier-model 구성에서는 decode가 전체 model-inference time의 75%에서 97%를 차지했으며, Model Bandwidth Utilization(MBU)은 설치된 메모리 대역폭 중 모델 가중치와 KV cache 이동에 실제 사용되는 비율을 나타낸다. SN50 RDU는 432 MB distributed on-chip SRAM, dataflow 실행, persistent decoder, operator fusion, double buffering으로 데이터 이동과 연산을 겹치고, 800G Ethernet scale-up과 400G RoCEv2 scale-out으로 여러 칩 사이의 통신을 연결한다. SambaNova의 모델링에서는 DeepSeek-R1을 64개에서 256개 SN50 RDU로 확장할 때 사용자별 속도가 200에서 500 tokens per second로 증가하는 동안 MBU가 51%, 44%, 45%로 유지됐다.
섹션별 상세






용어 해설
- 모델 대역폭 활용률(Model Bandwidth Utilization)
- — Model Bandwidth Utilization은 시스템의 최대 메모리 대역폭 중 모델 가중치와 KV cache를 실제 토큰 생성에 사용한 비율이다. 설치된 대역폭에 MBU를 곱하면 모델이 활용하는 유효 대역폭을 계산할 수 있어, 이론적 메모리 성능과 실제 tokens per second 사이를 연결한다.
- Decode
- — Decode는 입력을 처리한 뒤 모델이 토큰을 하나씩 생성하는 추론 단계다. 각 토큰 생성 과정에서 모델 가중치와 KV cache를 메모리에서 반복적으로 읽기 때문에 연산 성능보다 메모리 대역폭과 데이터 이동 효율의 영향을 크게 받는다.
- KV Cache
- — KV cache는 Transformer가 이전 토큰의 key와 value를 저장해 긴 문맥을 매번 다시 계산하지 않도록 하는 메모리 구조다. 에이전트 추론에서는 생성 토큰과 대화 문맥이 늘면서 KV cache 이동량이 커져 메모리 대역폭과 네트워크 설계의 주요 대상이 된다.
- Tensor Parallelism
- — Tensor Parallelism은 하나의 대형 텐서 연산을 여러 RDU에 나누고 reduce-scatter, all-gather, all-reduce 같은 collective 통신으로 결과를 결합하는 방식이다. 행렬 계산과 통신을 동시에 진행하려면 scale-up fabric이 반복적인 데이터 교환을 따라가야 한다.
- Expert Parallelism
- — Expert Parallelism은 Mixture-of-Experts 모델에서 토큰별로 선택된 expert에 입력을 분산하고 결과를 다시 결합하는 방식이다. 배치마다 목적지가 달라지는 동적 트래픽이 발생하므로 all-to-all과 broadcast-and-filter처럼 서로 다른 통신 전략이 필요하다.
기술
- SN50 RDU
- Dataflow Architecture
- Model Bandwidth Utilization
- distributed on-chip SRAM
- 800G Ethernet
- 400G RoCEv2 NIC
- Tensor Parallelism
- Expert Parallelism
- NVIDIA H200
- MiniMax M2.7
- DeepSeek-R1
- DeepSeek-V3
- B300 FP4
활용 사례
- 에이전트 추론
- 도구 호출과 장기 작업을 수행하는 AI 시스템
- Prefill과 decode를 분리한 이기종 추론
- 대규모 Dense frontier model 추론
- Mixture-of-Experts 모델의 Expert Parallelism
- KV-cache transfer를 활용한 disaggregated inference
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
