본문으로 건너뛰기

Qwen3.8-27B용 Blackwell 최적화 NVFP4 GGUF

Blackwell용 NVFP4 GGUF가 RTX 5090에서 6250 t/s를 기록했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

게시자는 Blackwell 하드웨어의 prefill에 맞춘 Qwen3.8-27B NVFP4 GGUF를 공개했다. RTX 5090 32GB의 pp2048 벤치마크에서 6250 t/s를 기록해 unsloth NVFP4의 6010 t/s와 Q4_0의 4130 t/s를 앞섰으며, 같은 메모리 용량의 Q4 양자화보다 50% 빠르다고 밝혔다. 파일에는 양자화된 MTP draft head도 포함됐고 권장 설정 적용 시 MTP 속도가 15% 향상된다.

실용적 조언

  • RTX 5090 32GB에서 Qwen3.8-27B를 실행할 때는 이 NVFP4 GGUF와 게시자가 지정한 MTP 권장 설정을 함께 사용하는 편이 좋다. 기본 비교 기준은 pp2048이며, 게시물의 측정값은 NVFP4 6250 t/s, unsloth NVFP4 6010 t/s, Q4_0 4130 t/s, Q6_K 3210 t/s이다. MTP를 활성화할 경우에는 연결된 권장 설정을 적용해야 게시자가 제시한 15% 속도 향상을 기대할 수 있다.

섹션별 상세

01
게시물은 Blackwell 네이티브이자 prefill 최적화형인 NVFP4 양자화 파일이 같은 메모리 용량의 Q4 양자화보다 호환 하드웨어에서 50% 빠르다고 밝혔다. RTX 5090 32GB의 pp2048 테스트에서 NVFP4는 6250 t/s를 기록했으며, unsloth NVFP4의 6010 t/s보다 4%, Q4_0의 4130 t/s보다 약 51% 높았다. Q6_K는 3210 t/s에 그쳐 낮은 비트 수와 하드웨어별 실행 경로를 결합한 구성이 처리량 차이로 이어졌다.
02
이 GGUF에는 일반 모델 가중치만이 아니라 양자화된 MTP draft head도 함께 들어 있다. 게시자가 연결한 권장 설정을 적용하면 MTP 사용 시 추가로 15% 빠른 처리가 가능하다고 안내했다. 따라서 이 파일의 성능 평가는 기본 NVFP4 속도뿐 아니라 draft head와 설정을 포함한 실제 추론 구성까지 함께 봐야 한다.

용어 해설

NVFP4 양자화(NVFP4)
NVFP4는 모델 가중치와 중간 표현을 4비트 부동소수점 형식으로 줄이는 양자화 방식이다. 이 글에서는 Blackwell 하드웨어의 prefill 처리에 맞춰 메모리 사용량을 낮추면서 Q4 계열보다 높은 속도를 내는 방식으로 활용됐다.
GGUF 모델 형식(GGUF)
GGUF는 양자화된 언어 모델을 저장하고 로컬 추론 환경에서 불러오는 데 쓰이는 파일 형식이다. 이 글의 GGUF 파일에는 NVFP4 양자화 모델뿐 아니라 MTP용 draft head도 함께 담겼다.
프리필(Prefill)
Prefill은 입력 프롬프트의 여러 토큰을 먼저 처리해 추론 상태를 만드는 단계다. 이 글의 양자화 파일은 Blackwell 하드웨어에서 이 단계의 처리 속도를 높이도록 최적화됐으며 pp2048 벤치마크로 성능을 측정했다.
멀티 토큰 예측(MTP)
MTP는 본 생성 모델과 별도의 draft head를 사용해 다음 토큰 후보를 미리 예측하는 추론 방식이다. 게시물의 GGUF에는 양자화된 MTP draft head가 포함됐고, 권장 설정을 적용하면 MTP 속도가 15% 향상된다고 안내됐다.

언급된 도구

GGUF추천링크

Qwen3.8-27B의 NVFP4 양자화 파일과 MTP draft head를 함께 배포하는 모델 파일 형식

MTP추천링크

양자화된 draft head를 이용해 추론 속도를 높이는 방식

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 21.수집 2026. 08. 21.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.