INT4 양자화
모델 가중치를 4비트 정수로 압축하는 기법으로, 체크포인트와 GPU 상의 메모리 점유를 크게 줄여 동일 하드웨어에서 더 큰 KV 캐시를 유지하거나 더 많은 모델을 배치할 수 있도록 합니다.