TL;DR
Frontier-level 모델의 총 파라미터가 다시 1조를 넘어서면서, 추론의 핵심 병목이 연산 성능보다 메모리 용량과 데이터 공급 속도로 이동했습니다. GPT-4 이후 모델은 하드웨어 제약에 맞춰 수천억 파라미터대로 줄었지만, Mixture of Experts와 추론 기법의 발전으로 Kimi K3는 2.8조, DeepSeek 최신 모델은 1.6조 파라미터 규모에 도달했습니다. Attention-FFN Disaggregation과 Speculative Decoding은 SRAM의 속도로 지연 시간을 낮추지만 SRAM의 작은 용량이라는 한계를 가집니다. 이에 따라 DRAM을 수직 적층해 단일 카드의 메모리를 10배 이상 늘리고, 카드 간 이동과 대역폭·에너지 손실을 줄이는 구조가 다음 해법으로 제시됩니다.
섹션별 상세
이미지 분석

차트는 GPT-4가 약 1.7조 파라미터로 먼저 등장한 뒤 모델 규모가 한동안 2,000억~1조 미만으로 줄었다가, 2025년과 2026년에 Kimi K2·K2.5·K2.6 및 K3, Qwen3.8-Max, DeepSeek-V4-Pro 등이 다시 1조 파라미터 선을 넘는 흐름을 보여줍니다. 본문의 핵심인 하드웨어 제약에 따른 모델 축소와 Mixture of Experts·추론 기법 발전 이후의 재확장을 시간순으로 뒷받침합니다.
2023년 2월부터 2026년 8월까지 공개 가중치 모델의 전체 파라미터 규모를 연도별로 나타낸 차트입니다.
용어 해설
- Mixture of Experts
- — 전체 파라미터를 매 토큰마다 모두 활성화하지 않고 일부 Expert만 선택해 계산하는 모델 구조입니다. 총 파라미터 규모를 키우면서도 실제 연산량을 제한할 수 있지만, 비활성 Expert를 포함한 전체 가중치와 상태를 메모리에 보관해야 하므로 추론에서는 메모리 용량과 대역폭이 병목이 될 수 있습니다.
- 고대역폭 메모리(High-Bandwidth Memory)
- — GPU와 가까운 위치에서 넓은 메모리 대역폭을 제공하는 DRAM 기반 메모리입니다. 대형 모델의 가중치를 담을 수 있는 용량을 제공하지만, 여러 카드 사이에서 데이터를 이동하거나 활성 파라미터를 공급하는 과정에서 지연 시간과 처리량 사이의 절충이 생길 수 있습니다.
- 메모리 장벽(Memory Wall)
- — 연산 장치의 계산 속도보다 메모리에서 데이터를 읽고 전달하는 속도가 느려져 전체 추론 성능을 제한하는 현상입니다. 대형 Mixture of Experts 모델에서는 한 토큰에 실제로 쓰는 파라미터가 일부여도 전체 Expert 라이브러리와 상태를 메모리에 유지해야 해 이 문제가 커집니다.
- Attention-FFN 분리(Attention-FFN Disaggregation)
- — 추론 과정의 Attention과 FFN 처리를 서로 분리해 각 단계에 적합한 메모리와 연산 자원을 배치하는 파이프라인 방식입니다. 메모리 풀을 연산 코어 가까이에 두고 SRAM의 속도를 활용함으로써 GPU 활용률과 사용자 지연 시간 사이의 절충을 완화하는 데 쓰입니다.
- Speculative Decoding
- — 작고 빠른 draft model이 다음 토큰 후보를 먼저 생성한 뒤 큰 모델이 이를 검증하는 추론 방식입니다. 본문에서는 sub-100B 모델을 draft model로 활용해 대형 모델의 토큰 생성 과정을 보조하고, 큰 모델의 지연 시간을 줄이는 파이프라인 구성과 연결합니다.
기술
- DRAM
- SRAM
- HBM
- GPU
- Mixture of Experts
- attention-FFN disaggregation
- speculative decoding
활용 사례
- 1조 파라미터급 Frontier-level 모델 추론
- 낮은 지연 시간이 필요한 프리미엄 AI 서비스
- sub-100B 모델을 활용한 단순 작업 처리
- Speculative Decoding의 draft model 운영
- 대형 Expert 라이브러리와 warm state 보관
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
