q8-kv-cache
Q8 KV 캐시
Transformer가 대화 문맥의 Key와 Value를 8비트 정수로 저장하는 메모리 절감 방식입니다. NInfer는 draft 가중치를 적재한 뒤에도 약 4.5~5.0 GiB를 KV cache에 남겨 약 128k context를 처리하도록 구성했습니다.
Q8 KV 캐시
Transformer가 대화 문맥의 Key와 Value를 8비트 정수로 저장하는 메모리 절감 방식입니다. NInfer는 draft 가중치를 적재한 뒤에도 약 4.5~5.0 GiB를 KV cache에 남겨 약 128k context를 처리하도록 구성했습니다.