본문으로 건너뛰기

q8-kv-cache

Q8 KV 캐시

Transformer가 대화 문맥의 Key와 Value를 8비트 정수로 저장하는 메모리 절감 방식입니다. NInfer는 draft 가중치를 적재한 뒤에도 약 4.5~5.0 GiB를 KV cache에 남겨 약 128k context를 처리하도록 구성했습니다.