섹션별 상세
LLM 추론의 핵심 병목은 연산 능력이 아닌 GPU 메모리 대역폭에서 발생한다. NVIDIA H100의 텐서 코어는 메모리가 데이터를 전달하는 속도보다 약 600배 빠르게 데이터를 처리할 수 있어 가중치 읽기 속도가 전체 성능을 제한한다. Unweight는 가중치 크기를 줄여 메모리 버스를 통과하는 데이터양을 최소화함으로써 이 문제를 해결한다. 이를 통해 동일한 하드웨어에서 더 많은 모델을 더 빠르게 실행할 수 있는 기반을 마련했다.
근거
- H100 GPU에서 텐서 코어는 메모리 전달 속도보다 거의 600배 빠르게 데이터를 처리한다. — On the NVIDIA H100 GPUs... tensor cores can process data nearly 600 times faster than memory can deliver it.
BF16 가중치 구조 중 지수 바이트의 높은 중복성을 활용해 무손실 압축을 구현했다. 연구 결과 LLM 레이어 내 256개의 가능한 지수 값 중 상위 16개가 전체 가중치의 99% 이상을 차지하며, 이는 정보 이론상 약 2.6비트만으로 표현 가능하다. Unweight는 부호와 가수는 유지한 채 지수 부분에만 허프만 코딩을 적용하여 MLP 가중치 스트림을 약 30% 압축한다. 희귀한 지수 값을 가진 행은 별도로 처리하여 실행 경로에서의 분기 처리를 최적화했다.

근거
- Unweight는 Llama-3.1-8B 모델에서 MLP 가중치를 약 30% 압축하여 전체 모델 크기를 15-22% 줄인다. — Our initial results on Llama-3.1-8B show ~30% compression of Multi-Layer Perceptron (MLP) weights alone.
- 상위 16개의 가장 흔한 지수 값이 일반적인 레이어 가중치의 99% 이상을 차지한다. — The top 16 most common exponents cover over 99% of all weights in a typical layer.
워크로드에 따라 최적의 성능을 내기 위해 네 가지 실행 파이프라인과 오토튜너를 제공한다. 전체 허프만 디코딩, 지수 전용 디코딩, 팔레트 트랜스코딩, 전처리 생략 등 네 가지 전략 중 배치 크기와 가중치 행렬 모양에 가장 적합한 방식을 선택한다. 배치 크기가 작은 경우(1-64)에는 cuBLAS를 사용하는 단순 경로가 유리하고, 큰 배치(256+)에서는 커스텀 커널을 통한 복원 연산이 더 높은 처리량을 보인다. 오토튜너는 실제 하드웨어 측정값을 기반으로 모델별 최적 설정을 생성한다.
복원 행렬 곱셈(Reconstructive Matmul) 커널을 통해 압축 해제와 연산을 하나로 통합했다. 이 커널은 HBM에서 압축된 데이터를 로드한 후 공유 메모리에서 BF16 값을 복원하고 즉시 Hopper의 WGMMA 텐서 코어 명령어로 전달한다. 복원된 가중치는 메인 메모리에 기록되지 않고 온칩 내에서만 존재하여 메모리 대역폭 낭비를 방지한다. 생산자 그룹이 데이터를 스테이징하고 소비자 그룹이 연산하는 구조로 설계되어 메모리 지연 시간을 효과적으로 숨긴다.
기술
- Llama 3.1
- NVIDIA H100
- Rust
- CUDA
- Hopper Architecture
활용 사례
- 엣지 네트워크에서의 저지연 LLM 추론
- 제한된 VRAM 환경에서의 대규모 모델 실행
- 모델 배포 시 네트워크 전송 시간 단축
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 17.수집 2026. 04. 17.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
