본문으로 건너뛰기

NVIDIA B200에서 MXFP8 및 NVFP4 양자화를 활용한 확산 모델 추론 가속화

NVIDIA Blackwell 아키텍처의 MXFP8 및 NVFP4 양자화 기술을 활용해 Flux.1-Dev 등 확산 모델의 추론 성능을 최대 1.68배 가속화하는 방법과 벤치마크 결과를 제시한다.

섹션별 상세

01
확산 모델의 높은 메모리 및 연산 요구사항을 해결하기 위해 Blackwell 아키텍처 전용 마이크로스케일링 포맷을 도입했다. MXFP8은 8비트 블록 스케일링을 통해 품질 저하 없는 가속을 제공하며, NVFP4는 4비트 포맷으로 이론상 최대 처리량과 최소 메모리 점유율을 실현한다. 이를 통해 B200 GPU에서 기존 BF16 대비 현저한 성능 이득을 얻을 수 있다.
NVIDIA B200 GPU에서 Flux-1.dev, LTX-2, QwenImage 모델의 BF16 대비 추론 가속도를 보여주는 막대 그래프
ChartMXFP8과 NVFP4 양자화가 세 가지 주요 모델에서 모두 유의미한 성능 향상을 제공함을 보여준다. 특히 LTX-2 모델에서 NVFP4를 사용했을 때 1.68배로 가장 높은 가속 효율을 기록했음을 수치로 증명한다.
02
선택적 양자화 기법을 사용하여 모델의 정확도와 추론 속도 사이의 최적의 균형을 찾았다. 가중치나 활성화 형상이 너무 작아 양자화 이득보다 오버헤드가 큰 레이어(min(M, K, N) < 1024)나 정확도에 민감한 임베딩 레이어 등을 양자화 대상에서 제외했다. Flux.1-Dev 테스트 결과, 선택적 양자화가 전체 양자화보다 낮은 LPIPS 점수(더 높은 품질)와 더 빠른 속도를 동시에 기록했다.
python
from diffusers import DiffusionPipeline, TorchAoConfig, PipelineQuantizationConfig
import torch
from torchao.prototype.mx_formats.inference_workflow import (
    NVFP4DynamicActivationNVFP4WeightConfig,
)

config = NVFP4DynamicActivationNVFP4WeightConfig(
    use_dynamic_per_tensor_scale=True,
    use_triton_kernel=True,
)
pipe_quant_config = PipelineQuantizationConfig(
    quant_mapping={"transformer": TorchAoConfig(config)}
)
pipe = DiffusionPipeline.from_pretrained(
    "black-forest-labs/FLUX.1-dev",
    torch_dtype=torch.bfloat16,
    quantization_config=pipe_quant_config
).to("cuda")
pipe.transformer.compile_repeated_blocks(fullgraph=True)

TorchAO의 NVFP4 양자화 설정을 Diffusers 파이프라인에 적용하고 지역 컴파일을 활성화하는 예시

03
작은 배치 사이즈에서 발생하는 CPU 오버헤드를 해결하기 위해 CUDA Graphs를 결합한 'reduce-overhead' 컴파일 모드를 적용했다. QwenImage 모델의 배치 사이즈 1 환경에서 CUDA Graphs 적용 시 GPU 트레이스의 공백(bubbles)이 사라지며 약 1.81배의 추가 속도 향상이 확인됐다. 이는 실시간 서비스 환경에서 지연 시간을 단축하는 데 결정적인 역할을 한다.
CUDA Graphs 적용 전후의 QwenImage 트랜스포머 블록 GPU 트레이스 비교
DiagramCUDA Graphs가 꺼져 있을 때는 GPU 트레이스에 큰 공백(bubbles)이 발생하여 연산 효율이 떨어지지만, 켰을 때는 공백이 거의 사라지며 약 2배 가까운 속도 향상이 일어남을 시각적으로 분석한다.
04
양자화에 따른 이미지 품질 저하를 객관적으로 평가하기 위해 LPIPS 지표를 활용한 벤치마크를 수행했다. Flux.1-Dev의 경우 MXFP8은 0.11, NVFP4는 0.44의 평균 LPIPS를 기록하여 시각적으로 원본과 매우 유사한 결과를 보였다. 반면 QwenImage는 양자화에 더 민감하게 반응하여 추가적인 알고리즘 최적화의 필요성을 시사했다.
LPIPS 점수 0.4384를 기록한 원본과 양자화 모델 간의 생성 이미지 비교 (장어)
PhotoLPIPS 점수가 상대적으로 높은(0.43대) 경우, 이미지의 구도나 피사체의 형태가 원본과 다소 달라질 수 있음을 보여주며 양자화에 따른 품질 변화의 기준을 제시한다.

용어 해설

마이크로스케일링 포맷(Microscaling Formats)
텐서 전체가 아닌 작은 블록 단위(16~32개 요소)로 고정밀 스케일 인자를 공유하는 양자화 방식이다. 이를 통해 낮은 비트 깊이에서도 넓은 동적 범위를 유지하며 정확도 손실을 최소화할 수 있다.
MXFP8
OCP 표준의 8비트 마이크로스케일링 부동소수점 포맷이다. BF16 대비 시각적 품질 저하가 거의 없으면서도 빠른 추론 속도를 제공하여 성능과 정확도의 균형이 뛰어나다.
NVFP4
NVIDIA Blackwell 아키텍처에서 가속되는 4비트 부동소수점 포맷이다. 가장 높은 처리량과 가장 낮은 메모리 점유율을 제공하여 연산 집약적인 대규모 배치 작업에 최적화되어 있다.
LPIPS
인간의 시각적 인지 유사도를 측정하는 딥러닝 기반 지표이다. 두 이미지 간의 차이를 수치화하며, 0에 가까울수록 원본과 시각적으로 구별하기 어려울 만큼 유사함을 의미한다.
CUDA 그래프(CUDA Graphs)
GPU 작업을 일련의 그래프 형태로 정의하여 CPU 오버헤드를 줄이는 기술이다. 특히 배치 사이즈가 작은 추론 환경에서 CPU의 커널 실행 준비 시간을 단축해 전체 지연 시간을 크게 개선한다.

기술

  • NVIDIA B200
  • TorchAO
  • Diffusers
  • PyTorch
  • MXFP8
  • NVFP4
  • CUDA Graphs

활용 사례

  • 실시간 이미지 생성 서비스
  • 고해상도 비디오 생성 파이프라인 가속
  • GPU 메모리 제한 환경에서의 대규모 모델 서빙
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 09.수집 2026. 04. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.