본문으로 건너뛰기

V100 네 장, RTX 5090과 Qwen3.8 디코드 동률

QPN과 Native MTP가 V100 네 장의 Qwen3.8 디코드를 RTX 5090 한 장과 동률로 끌어올렸다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

2017년형 V100 네 장이 v100-skinny의 QPN 커널과 Qwen3.8 Native MTP를 통해 RTX 5090 한 장과 단일 요청 Decode에서 각각 219.1 ± 5.9 tok/s와 214.7 ± 9.2 tok/s를 기록했습니다. V100은 라운드당 5.89개 토큰을 확정해 RTX 5090의 4.27개보다 많았고, 26.9ms의 느린 라운드 시간이 더 깊은 검증량으로 상쇄됐습니다. QPN은 FP4·FP8 가중치를 HBM에서 읽는 동시에 FP16 레지스터 형식으로 변환해 V100의 기존 Tensor Core에 연결하며, v1.1에서는 게시된 혼합 FP4/FP8 배치를 그대로 유지합니다. 다만 Prefill은 NInfer가 대략 4배 빠르고, 약 65K 컨텍스트에서는 k=3이 76.3 tok/s로 k=7의 54.7 tok/s보다 빨라 사용 조건에 따른 깊이 조정이 필요합니다.

실용적 조언

  • V100에서 Qwen3.8을 실행할 때는 게시된 혼합 FP4/FP8 Checkpoint를 유지하고 FP4 영역에는 QPN2, FP8 영역에는 QPN8 경로를 사용해야 합니다. V100은 FP4와 FP8 Tensor Core 명령어가 없으므로 압축 데이터를 HBM에서 읽으면서 FP16 레지스터 형식으로 변환하는 방식이 필요합니다. 전체 모델을 먼저 FP16으로 복원하면 이 글의 메모리와 대역폭 이점을 잃게 됩니다.
  • 짧은 요청에서는 Native MTP k=7이 유리하지만 약 65K live context에서는 k=3을 선택하는 편이 측정상 빠릅니다. k=7은 긴 KV history를 Drafter의 각 단계에서 반복해서 통과하면서 추가 확정 토큰을 충분히 늘리지 못해 54.7 tok/s에 그쳤습니다. 같은 조건에서 k=3은 76.3 tok/s, MTP 비활성화는 65.5 tok/s였습니다.
  • V100 서버의 실사용 성능을 평가할 때는 Decode와 Prefill을 분리해야 합니다. 이 비교에서는 V100과 RTX 5090이 단일 요청 Decode에서 parity를 보였지만, Prefill은 NInfer가 대략 4배 빠르므로 전체 대화형 지연시간이나 긴 입력 처리에서는 같은 결론을 적용할 수 없습니다. 네 장의 V100은 가속기 비용만 약 A$600이고 서버 본체, CPU, RAM, 냉각, 전력 비용은 별도입니다.

섹션별 상세

게시자는 2017년형 V100 네 장이 RTX 5090 한 장과 Qwen3.8 단일 요청 Decode에서 동률에 도달했다고 보고했습니다. V100은 v100-skinny로 Qwen3.8의 게시된 혼합 FP4/FP8 가중치를 실행했고, RTX 5090은 해당 GPU에 맞춘 NInfer를 사용했습니다. 같은 실험실에서 Decode 처리량은 V100이 219.1 ± 5.9 tok/s, RTX 5090이 214.7 ± 9.2 tok/s였으며 AIME 2026 문제 1의 다섯 시드에서 양쪽 모두 5/5 정답을 기록해 결론은 우열보다 parity에 가깝습니다.
V100 시스템은 한 라운드 처리에 26.9ms가 걸려 RTX 5090의 19.9ms보다 35% 느렸지만, 라운드당 5.89개 토큰을 확정해 RTX 5090의 4.27개보다 38% 많은 유효 작업을 처리했습니다. 따라서 RTX 5090은 각 라운드를 빠르게 끝내고 V100은 더 깊은 Native MTP 검증으로 한 라운드의 산출량을 늘리는 구조입니다. 게시자는 1.38 / 1.35 ≈ 1.02라는 비율로 두 효과가 상쇄된다고 계산했으며, V100은 k=7, NInfer는 draft-tokens=5를 사용했습니다.
QPN은 V100에 없는 FP4와 FP8 Tensor Core 명령어를 소프트웨어 변환으로 보완합니다. 모델을 먼저 거대한 FP16 배열로 복원하지 않고 HBM에서 압축된 작은 조각을 읽은 뒤 Volta Tensor Core가 소비하는 FP16 레지스터 형식으로 바로 바꾸며, 879 GB/s 읽기 전용 한계에서 QPN2 NVFP4 M=8은 619.8 GB/s와 71%, QPN8 FP8은 약 719 GB/s와 82%를 기록했습니다. V100의 Tensor instruction이 자연스럽게 처리하는 8행 타일에 k=7 검증 라운드를 매핑한 점이 여러 후보 토큰을 싸게 확인하는 핵심 구조입니다.
v1.0은 V100에서 실행 경로가 없던 FP8 영역을 NVFP4로 바꿔 파생 Checkpoint를 만들었지만, v1.1은 FP8 영역을 QPN8로 직접 처리해 게시된 혼합 배치를 유지합니다. 게시자는 all-FP4 파생 모델이 50개 하드웨어 생성 테스트에서 한 카테고리와 네 개의 고유 이름만 내놓고 브랜드 항목을 50개 반복한 반면, 게시된 혼합 가중치는 12개 카테고리와 50개의 고유 이름을 생성했다고 비교했습니다. 처리량만 높이고 출력 다양성과 모델 품질을 훼손하는 결과를 피하려면 원래 FP4/FP8 배치를 보존하는 실행 경로가 중요하다는 결론입니다.
전체 서버 성능에서는 GEMM만 빠르게 만드는 것보다 Attention, Recurrent state, Tensor Parallelism, Native MTP, CUDA Graphs, Sampling, API Endpoint를 함께 최적화하는 일이 중요했습니다. FP8-KV 설정은 SM70에서 느린 스칼라 Attention 경로를 선택했고, Drafter의 자체 Sampling, 불필요한 상태 동기화와 복사, 큰 Max Context가 Decode 파티션 형상을 오염시키는 문제도 별도 병목으로 확인됐습니다. 약 65K live context에서는 k=7이 54.7 tok/s, MTP 비활성화가 65.5 tok/s, k=3이 76.3 tok/s였으므로 고정된 깊이보다 컨텍스트 길이에 맞춘 MTP 깊이 선택이 필요합니다.

용어 해설

Native MTP
Native MTP는 별도 Draft Model 없이 대상 모델 자체가 다음 토큰 후보를 여러 개 생성하고 한 번에 검증하는 구조입니다. 후보 생성 횟수와 검증 비용의 균형에 따라 Decode 처리량이 달라집니다.
NVFP4
NVFP4는 4비트 부동소수점 양자화 형식으로, 이 글에서는 Blackwell GPU의 FP4 전용 Tensor Core와 함께 쓰이는 형식입니다. V100은 해당 전용 명령어가 없어 QPN이 이를 FP16 레지스터 형식으로 변환합니다.
QPN
QPN은 압축된 FP4 또는 FP8 가중치를 HBM에서 읽은 뒤 작은 조각 단위로 Volta Tensor Core가 처리할 수 있는 FP16 레지스터 형식으로 직접 변환하는 커널입니다. 전체 모델을 먼저 FP16으로 펼치는 메모리 비용을 피합니다.
QPN2와 QPN8(QPN2/QPN8)
QPN2는 NVFP4 영역을, QPN8은 FP8 영역을 V100의 SM70 실행 경로에 맞춰 처리하는 방식입니다. v1.1에서는 게시된 혼합 FP4/FP8 가중치 배치를 바꾸지 않고 각 영역을 원래 형식대로 실행합니다.
KV cache
KV cache는 이전 토큰의 Attention Key와 Value를 저장해 긴 대화에서 반복 계산을 줄이는 메모리 구조입니다. 이 글의 V100 경로에서는 FP8-KV 설정이 느린 스칼라 Attention 경로를 선택해 FP16 KV cache를 사용합니다.
추측 디코딩(Speculative Decoding)
추측 디코딩은 Drafter가 후보 토큰을 먼저 만들고 Target 모델이 여러 후보를 묶어 검증하는 처리 방식입니다. 이 글에서는 QPN이 k=7 후보 검증을 V100 Tensor Core의 8행 타일에 맞춰 검증 비용을 낮춥니다.

언급된 도구

v100-skinny추천링크

V100의 SM70에서 Qwen3.8 혼합 FP4/FP8 가중치와 Native MTP를 실행하는 서버 및 커널 구현

NInfer중립

RTX 5090에서 Qwen3.8 Decode를 최적화한 전문 추론 엔진

1Cat-vLLM추천

SM70에서 최신 vLLM과 FlashAttention을 사용할 수 있게 한 기반 구현

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 20.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.