하이브리드 양자화
하이브리드 양자화는 모델의 서로 다른 구성요소에 계층별로 다른 비트 정밀도를 적용하는 포스트 트레이닝 양자화 전략이다. 본 논문은 FFN 가중치를 4비트로, 대부분의 선형층 가중치는 FP8로 유지하고 활성화는 16비트로 관리해 메모리 점유를 1GB 미만으로 감축했다. 이 방식은 정밀도와 배포 효율 사이의 균형을 맞추는 현실적 절충안이다.