TL;DR
대형 LLM의 실용적 분산 인퍼런스를 목표로 WAN상에서 여러 GPU를 연결하는 Shard의 설계와 실험을 소개한다. 먼저 GLM-5.2(744B)를 단일 GPU에 얹는 것이 불가능에 가깝다는 문제에서 출발해, 모델을 연속 블록으로 분할하고 각 블록을 서로 다른 GPU에 배치하는 파이프라인 병렬화 구조를 제안한다. 코디네이터는 모델 레이어를 전혀 보유하지 않고 임베딩/헤드를 통해 토큰을 추진하며, activations은 네트워크를 따라 전달된다. 이 과정에서 WAN 상의 30tok/s 수준의 처리 속도가 달성되며, 모든 실행은 verifiable receipt로 기록되어 신뢰성을 확보한다. WAN 지연이 병목이라는 근본 인식 아래, 추정 디코딩과 비동기 파이프라이닝으로 토큰 단위 왕복을 겹치고, CUDA-그래프 드래프트를 도입해 오버헤드를 크게 줄임으로써 3.8배의 속도 향상을 얻었다. 이로써 WAN 기반 분산 추론의 실용성을 입증하고, 향후 120B 모델의 퍼미션리스 스웜(Phase 3)으로 확장하는 로드맵도 제시한다.
섹션별 상세
- GLM-5.2 744B를 WAN 상의 7대 프로슈머 GPU에 분산 실행해 약 30 tok/s를 달성했다. — A 744-billion-parameter frontier model, served at ~30 tok/s across seven prosumer Blackwell GPUs in six US states — over WAN 출처
- WAN 지연이 병목이며, 추정 디코딩과 비동기 파이프라이닝이 처리량 향상의 핵심이다. — The key insight: over WAN the round-trip is the scarce resource, not compute — so speculative decoding, marginal in a datacenter, becomes the whole game. 출처
- CUDA-graphed draft를 도입하면 전체 파이프라인이 3.8× 빠르게 동작하고, 49.7→13.1 ms/tok의 개선이 확인된다. — CUDA-graphed draft (3.8×) lifts the whole pipeline; 49.7→13.1 ms/tok 출처
- 코디네이터는 모델 레이어를 보유하지 않으며, draft만으로 토큰의 합성 및 검증을 수행한다. — The coordinator (WA) ── GLM-4-9B draft (CUDA-graphed) + embed / lm_head ... The coordinator holds no model layers 출처
- gpt-oss-120B은 퍼미션리스 스웜의 타깃으로, 최대 약 40 tok/s(피크 42) 수준의 속도를 보인다. — gpt-oss-120B at ~40 tok/s (peak ~42) 출처
용어 해설
- 파이프라인 병렬화(Pipeline-parallel)
- — 대형 모델을 여러 GPU에 걸쳐 층 단위로 나눠 병렬로 실행하는 구성으로, 각 GPU가 특정 레이어 블록을 실행하고 결과를 다음 노드로 전달해 전체 실행 시간을 단축한다.
- 추정 디코딩(Speculative Decoding)
- — 다음 토큰 후보를 사전에 계산하고 실제 필요 토큰만 선택해 추론 속도를 높이는 기법으로 WAN 환경에서 대역폭과 지연 이슈를 상쇄한다.
- CUDA 그래프(CUDA-graph)
- — CUDA 연산을 하나의 그래프로 미리 구성해 재사용함으로써 실행 오버헤드를 줄이고 반복 작업의 처리량을 높이는 최적화 기법이다.
- KV 캐시(KV cache)
- — 레이어별 키-값 캐시를 유지해 이전 토큰의 상태를 재사용하고 재계산을 줄여 추론 속도를 높이는 기술이다.
- WAN 지연(WAN Latency)
- — WAN 환경에서 토큰 단위 왕복 시간이 전체 처리량의 병목이 되므로, 비동기 파이프라이닝과 추정 디코딩으로 이를 완화하는 것이 핵심이다.
기술
- Python
- Go
- CUDA
- RTX 6000
- ChaCha20-Poly1305
- pickle-free framing
활용 사례
- WAN 기반 frontier-model 인퍼런스
- 퍼미션리스 스웜 구축(분산 자원 참여)
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.