W4A8 양자화
W4A8은 가중치를 4비트로, 활성화(activation)를 8비트로 양자화하는 기법으로, 연산량과 메모리 사용량을 낮춰 임베디드 디바이스에서 신경망을 실행 가능하게 한다. 이 방식은 모델의 정밀도를 일부 낮추는 대가로 연산 효율을 크게 향상시켜 NPU 같은 하드웨어에서 추론 성능을 개선하는 데 주로 사용된다. 구현 측면에서는 양자화 스케일과 제로 포인트 설정, 양자화-비양자화 오버헤드 최소화가 핵심이다.