섹션별 상세
MXFP4 양자화의 핵심 과제는 OCP MX 그룹(32개 요소) 내에 존재하는 이상치(outlier)가 전체 스케일 팩터에 영향을 주어 나머지 값들의 정밀도를 떨어뜨리는 현상이다. 이상치가 포함된 그룹은 스케일이 커지면서 작은 값들의 정보가 소실되는 문제가 발생한다.

온라인 회전 기법은 추론 시 활성화 데이터에 직교 변환(Orthogonal Transform)을 적용하여 특정 채널에 집중된 이상치를 여러 채널로 분산시킨다. 이를 통해 OCP MX 그룹 내의 값 범위를 좁히고 양자화 오차를 줄이며, 역변환은 오프라인에서 가중치에 미리 융합(fuse)하여 계산 효율을 높인다.
SmoothQuant와 회전을 결합한 O = DR 변환을 통해 채널 스케일링과 회전을 동시에 최적화한다. Cayley SGD 옵티마이저를 사용하여 Stiefel 다양체 상에서 회전 행렬을 미세 조정함으로써 고정된 Hadamard 회전보다 더 높은 정확도 복구율을 달성한다.

연산 효율성을 위해 전체 행렬 대신 블록 대각(Block-diagonal) 구조의 회전을 적용한다. 32x32 또는 128x128 크기의 작은 블록 단위로 회전을 수행하면 전체 Hidden Dimension에 대한 연산보다 오버헤드가 훨씬 적으며, 이는 대규모 모델의 GEMM 연산량 대비 미미한 수준이다.

Qwen3-8B, 14B, 32B 모델 테스트 결과, 제안된 기법은 단순 양자화(RTN)나 기존 GPTQ, AutoSmoothQuant 대비 월등한 성능을 보였다. 특히 n-shot 작업에서 정확도 하락분의 45-55%를 복구하며 원본 BF16 모델 성능의 98% 이상을 유지하는 데 성공했다.

vLLM 서빙 벤치마크 결과, 최적화되지 않은 독립 실행형 커널 구현에서도 전체 토큰 처리량(Throughput) 저하는 관리 가능한 수준으로 나타났다. 향후 동적 양자화 및 GEMM 연산과 회전 연산을 하나로 합친 퓨즈드 커널(Fused Kernel)을 통해 지연 시간을 추가로 단축할 수 있다.
기술
- MXFP4
- AMD Instinct MI350X
- PyTorch
- vLLM
- AMD Quark
- Cayley SGD
활용 사례
- 저비용 고성능 LLM 추론 서비스
- 엣지/온디바이스용 모델 경량화
- 대규모 모델의 메모리 점유율 최적화
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 17.수집 2026. 02. 21.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
