Tensor Cores
Tensor 코어
GPU에서 행렬 곱셈을 고속 처리하는 전용 연산 유닛입니다. f16 KV 데이터는 변환 없이 Tensor 코어 경로에 전달되지만, q8_0은 역양자화된 스트림 때문에 같은 경로를 효율적으로 활용하기 어렵습니다.
Tensor 코어
GPU에서 행렬 곱셈을 고속 처리하는 전용 연산 유닛입니다. f16 KV 데이터는 변환 없이 Tensor 코어 경로에 전달되지만, q8_0은 역양자화된 스트림 때문에 같은 경로를 효율적으로 활용하기 어렵습니다.