섹션별 상세
확산 모델의 높은 메모리 및 연산 요구사항을 해결하기 위해 Blackwell 아키텍처 전용 마이크로스케일링 포맷을 도입했다. MXFP8은 8비트 블록 스케일링을 통해 품질 저하 없는 가속을 제공하며, NVFP4는 4비트 포맷으로 이론상 최대 처리량과 최소 메모리 점유율을 실현한다. 이를 통해 B200 GPU에서 기존 BF16 대비 현저한 성능 이득을 얻을 수 있다.

선택적 양자화 기법을 사용하여 모델의 정확도와 추론 속도 사이의 최적의 균형을 찾았다. 가중치나 활성화 형상이 너무 작아 양자화 이득보다 오버헤드가 큰 레이어(min(M, K, N) < 1024)나 정확도에 민감한 임베딩 레이어 등을 양자화 대상에서 제외했다. Flux.1-Dev 테스트 결과, 선택적 양자화가 전체 양자화보다 낮은 LPIPS 점수(더 높은 품질)와 더 빠른 속도를 동시에 기록했다.
python
from diffusers import DiffusionPipeline, TorchAoConfig, PipelineQuantizationConfig
import torch
from torchao.prototype.mx_formats.inference_workflow import (
NVFP4DynamicActivationNVFP4WeightConfig,
)
config = NVFP4DynamicActivationNVFP4WeightConfig(
use_dynamic_per_tensor_scale=True,
use_triton_kernel=True,
)
pipe_quant_config = PipelineQuantizationConfig(
quant_mapping={"transformer": TorchAoConfig(config)}
)
pipe = DiffusionPipeline.from_pretrained(
"black-forest-labs/FLUX.1-dev",
torch_dtype=torch.bfloat16,
quantization_config=pipe_quant_config
).to("cuda")
pipe.transformer.compile_repeated_blocks(fullgraph=True)TorchAO의 NVFP4 양자화 설정을 Diffusers 파이프라인에 적용하고 지역 컴파일을 활성화하는 예시
작은 배치 사이즈에서 발생하는 CPU 오버헤드를 해결하기 위해 CUDA Graphs를 결합한 'reduce-overhead' 컴파일 모드를 적용했다. QwenImage 모델의 배치 사이즈 1 환경에서 CUDA Graphs 적용 시 GPU 트레이스의 공백(bubbles)이 사라지며 약 1.81배의 추가 속도 향상이 확인됐다. 이는 실시간 서비스 환경에서 지연 시간을 단축하는 데 결정적인 역할을 한다.

양자화에 따른 이미지 품질 저하를 객관적으로 평가하기 위해 LPIPS 지표를 활용한 벤치마크를 수행했다. Flux.1-Dev의 경우 MXFP8은 0.11, NVFP4는 0.44의 평균 LPIPS를 기록하여 시각적으로 원본과 매우 유사한 결과를 보였다. 반면 QwenImage는 양자화에 더 민감하게 반응하여 추가적인 알고리즘 최적화의 필요성을 시사했다.

용어 해설
- 마이크로스케일링 포맷(Microscaling Formats)
- — 텐서 전체가 아닌 작은 블록 단위(16~32개 요소)로 고정밀 스케일 인자를 공유하는 양자화 방식이다. 이를 통해 낮은 비트 깊이에서도 넓은 동적 범위를 유지하며 정확도 손실을 최소화할 수 있다.
- MXFP8
- — OCP 표준의 8비트 마이크로스케일링 부동소수점 포맷이다. BF16 대비 시각적 품질 저하가 거의 없으면서도 빠른 추론 속도를 제공하여 성능과 정확도의 균형이 뛰어나다.
- NVFP4
- — NVIDIA Blackwell 아키텍처에서 가속되는 4비트 부동소수점 포맷이다. 가장 높은 처리량과 가장 낮은 메모리 점유율을 제공하여 연산 집약적인 대규모 배치 작업에 최적화되어 있다.
- LPIPS
- — 인간의 시각적 인지 유사도를 측정하는 딥러닝 기반 지표이다. 두 이미지 간의 차이를 수치화하며, 0에 가까울수록 원본과 시각적으로 구별하기 어려울 만큼 유사함을 의미한다.
- CUDA 그래프(CUDA Graphs)
- — GPU 작업을 일련의 그래프 형태로 정의하여 CPU 오버헤드를 줄이는 기술이다. 특히 배치 사이즈가 작은 추론 환경에서 CPU의 커널 실행 준비 시간을 단축해 전체 지연 시간을 크게 개선한다.
기술
- NVIDIA B200
- TorchAO
- Diffusers
- PyTorch
- MXFP8
- NVFP4
- CUDA Graphs
활용 사례
- 실시간 이미지 생성 서비스
- 고해상도 비디오 생성 파이프라인 가속
- GPU 메모리 제한 환경에서의 대규모 모델 서빙
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 09.수집 2026. 04. 09.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
