양자화(ONNX INT8/INT4)
모델 가중치와 임베딩을 낮은 비트 정밀도로 변환해 메모리와 연산 비용을 줄이는 최적화 기법으로서 ONNX 형식에서 INT8 또는 INT4 임베딩을 사용하면 배포 이미지의 크기를 크게 낮출 수 있다. 게시물에서는 ONNX INT8과 INT4 임베딩으로 엣지 빌드를 제공하고 FP32 대비 성능 저하가 매우 작음을 보고했다.