본문으로 건너뛰기

FP4

FP4 양자화

FP4는 모델 가중치를 4비트 부동소수점 형식으로 저장해 메모리 사용량을 줄이는 양자화 방식입니다. 이 측정에서는 Q8_0보다 모델 메모리는 작았지만 긴 문맥의 Prefill 처리량은 더 빠르게 감소했습니다.