TL;DR
로컬 LLM의 양자화 포맷은 파일 크기만 줄이는 압축 방식이 아니라 GPU 세대와 실행 런타임의 지원 범위에 맞춰 선택해야 한다. Ampere의 RTX 30은 FP8을 저장 형식으로 로드할 수 있지만 FP16으로 변환해 계산하므로 네이티브 FP8 가속이 없고, Apple MPS는 변환 미구현으로 오류가 발생할 수 있다. GGUF·MLX처럼 런타임 이름을 쓰는 포맷은 각각 다양한 환경 또는 Apple Silicon에 맞고, FP8·NVFP4·INT4-W4A16처럼 수치 형식을 내세운 포맷은 특정 하드웨어 의존성이 크다. Apple Silicon에서는 LLM에 MLX, diffusion에 GGUF 또는 fp16 safetensors를 고르는 것이 글의 결론이다.
실용적 조언
- Apple Silicon에서 LLM을 실행할 때는 MLX 변형을 우선 선택하고, diffusion 모델은 GGUF 또는 fp16 safetensors를 우선 검토해야 한다.
- RTX 30 같은 Ampere GPU에서 FP8 파일을 사용할 경우 로드 가능 여부와 네이티브 FP8 연산 지원 여부를 분리해서 확인해야 한다. CUDA 환경에서는 FP16 변환을 거쳐 실행될 수 있지만, Apple MPS에서는 변환 미구현으로 오류가 날 수 있다.
- NVFP4는 Blackwell 전용 가속 포맷이므로 RTX 50이나 B200이 아닌 하드웨어에서는 다운로드 전에 실행 가능성을 확인해야 한다.
- EXL2·EXL3, AWQ, GPTQ, bitsandbytes 변형은 CUDA와 해당 런타임을 요구하므로 Apple Silicon용 모델을 고를 때 피해야 한다.
섹션별 상세
용어 해설
- Tensor Core 지원 형식(Tensor Core Formats)
- — GPU의 Tensor Core가 직접 처리할 수 있는 수치 형식이다. 세대별로 FP16·INT8·INT4에서 BF16·TF32, FP8, NVFP4로 지원 범위가 넓어지며, 모델 양자화 포맷의 실행 속도와 호환성을 좌우한다.
- 양자화(Quantization)
- — 모델 가중치를 더 낮은 비트 수의 수치 형식으로 바꿔 메모리 사용량을 줄이는 방식이다. 다만 실제 실행 속도는 단순한 파일 압축률이 아니라 GPU가 해당 형식을 네이티브로 계산하는지에 따라 달라진다.
- 8비트 부동소수점(FP8)
- — 8비트 부동소수점 형식으로, 글에서는 Ada Lovelace와 Hopper에서 Tensor Core가 직접 지원한다고 설명한다. Ampere에서도 저장 형식으로 로드할 수 있지만 FP16으로 변환해 계산하므로 메모리 절감과 네이티브 연산 속도를 구분해야 한다.
- NVFP4
- — Blackwell 세대에서 가속되는 4비트 부동소수점 형식이다. 글에 따르면 RTX 50과 B200 같은 Blackwell 하드웨어를 전제로 하며, 이전 NVIDIA GPU에서는 해당 형식의 가속을 기대할 수 없다.
- safetensors
- — 모델 가중치를 저장하는 파일 형식으로, 글에서는 fp16·bf16 safetensors가 모든 하드웨어에서 실행 가능한 범주로 분류된다. 구체적인 연산 지원은 저장 형식보다 내부 수치 형식과 실행 환경에 의해 결정된다.
언급된 도구
FP8 체크포인트를 로드한 뒤 FP16으로 변환해 계산하는 실행 환경
GGUF 모델을 실행하는 런타임
Apple Silicon에서 MLX 모델을 실행하는 프레임워크
EXL2·EXL3 포맷을 CUDA에서 실행하는 런타임
CUDA 환경에서 사용되는 양자화·모델 실행 관련 포맷 및 도구
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
