본문으로 건너뛰기

cq2-bit

CQ2-비트 양자화

CQ2-bit는 학습 전체(사전학습·후학습 포함)에서 양자화 방식을 적용해 2비트 표현으로 가중치와 활성값을 유지하는 기법이다. 모델이 훈련 단계에서부터 그 저비트 정밀도에 적응하도록 QAT(quantization-aware training)을 사용해 포스트호크 양자화에서 발생하는 성능 붕괴를 방지한다. 그 결과로 45M 파라미터 모델을 14MB 바이너리로 배포하면서도 참조 경로와 토큰 단위 정확도를 맞춘다.