TL;DR
2017년형 V100 네 장이 v100-skinny의 QPN 커널과 Qwen3.8 Native MTP를 통해 RTX 5090 한 장과 단일 요청 Decode에서 각각 219.1 ± 5.9 tok/s와 214.7 ± 9.2 tok/s를 기록했습니다. V100은 라운드당 5.89개 토큰을 확정해 RTX 5090의 4.27개보다 많았고, 26.9ms의 느린 라운드 시간이 더 깊은 검증량으로 상쇄됐습니다. QPN은 FP4·FP8 가중치를 HBM에서 읽는 동시에 FP16 레지스터 형식으로 변환해 V100의 기존 Tensor Core에 연결하며, v1.1에서는 게시된 혼합 FP4/FP8 배치를 그대로 유지합니다. 다만 Prefill은 NInfer가 대략 4배 빠르고, 약 65K 컨텍스트에서는 k=3이 76.3 tok/s로 k=7의 54.7 tok/s보다 빨라 사용 조건에 따른 깊이 조정이 필요합니다.
실용적 조언
- V100에서 Qwen3.8을 실행할 때는 게시된 혼합 FP4/FP8 Checkpoint를 유지하고 FP4 영역에는 QPN2, FP8 영역에는 QPN8 경로를 사용해야 합니다. V100은 FP4와 FP8 Tensor Core 명령어가 없으므로 압축 데이터를 HBM에서 읽으면서 FP16 레지스터 형식으로 변환하는 방식이 필요합니다. 전체 모델을 먼저 FP16으로 복원하면 이 글의 메모리와 대역폭 이점을 잃게 됩니다.
- 짧은 요청에서는 Native MTP k=7이 유리하지만 약 65K live context에서는 k=3을 선택하는 편이 측정상 빠릅니다. k=7은 긴 KV history를 Drafter의 각 단계에서 반복해서 통과하면서 추가 확정 토큰을 충분히 늘리지 못해 54.7 tok/s에 그쳤습니다. 같은 조건에서 k=3은 76.3 tok/s, MTP 비활성화는 65.5 tok/s였습니다.
- V100 서버의 실사용 성능을 평가할 때는 Decode와 Prefill을 분리해야 합니다. 이 비교에서는 V100과 RTX 5090이 단일 요청 Decode에서 parity를 보였지만, Prefill은 NInfer가 대략 4배 빠르므로 전체 대화형 지연시간이나 긴 입력 처리에서는 같은 결론을 적용할 수 없습니다. 네 장의 V100은 가속기 비용만 약 A$600이고 서버 본체, CPU, RAM, 냉각, 전력 비용은 별도입니다.
섹션별 상세
용어 해설
- Native MTP
- — Native MTP는 별도 Draft Model 없이 대상 모델 자체가 다음 토큰 후보를 여러 개 생성하고 한 번에 검증하는 구조입니다. 후보 생성 횟수와 검증 비용의 균형에 따라 Decode 처리량이 달라집니다.
- NVFP4
- — NVFP4는 4비트 부동소수점 양자화 형식으로, 이 글에서는 Blackwell GPU의 FP4 전용 Tensor Core와 함께 쓰이는 형식입니다. V100은 해당 전용 명령어가 없어 QPN이 이를 FP16 레지스터 형식으로 변환합니다.
- QPN
- — QPN은 압축된 FP4 또는 FP8 가중치를 HBM에서 읽은 뒤 작은 조각 단위로 Volta Tensor Core가 처리할 수 있는 FP16 레지스터 형식으로 직접 변환하는 커널입니다. 전체 모델을 먼저 FP16으로 펼치는 메모리 비용을 피합니다.
- QPN2와 QPN8(QPN2/QPN8)
- — QPN2는 NVFP4 영역을, QPN8은 FP8 영역을 V100의 SM70 실행 경로에 맞춰 처리하는 방식입니다. v1.1에서는 게시된 혼합 FP4/FP8 가중치 배치를 바꾸지 않고 각 영역을 원래 형식대로 실행합니다.
- KV cache
- — KV cache는 이전 토큰의 Attention Key와 Value를 저장해 긴 대화에서 반복 계산을 줄이는 메모리 구조입니다. 이 글의 V100 경로에서는 FP8-KV 설정이 느린 스칼라 Attention 경로를 선택해 FP16 KV cache를 사용합니다.
- 추측 디코딩(Speculative Decoding)
- — 추측 디코딩은 Drafter가 후보 토큰을 먼저 만들고 Target 모델이 여러 후보를 묶어 검증하는 처리 방식입니다. 이 글에서는 QPN이 k=7 후보 검증을 V100 Tensor Core의 8행 타일에 맞춰 검증 비용을 낮춥니다.
언급된 도구
V100의 SM70에서 Qwen3.8 혼합 FP4/FP8 가중치와 Native MTP를 실행하는 서버 및 커널 구현
RTX 5090에서 Qwen3.8 Decode를 최적화한 전문 추론 엔진
SM70에서 최신 vLLM과 FlashAttention을 사용할 수 있게 한 기반 구현
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.