triton-kernel-fusion
Triton kernel fusion
Triton kernel fusion은 absmax 계산, scale 산출, clipping, FP8 변환처럼 পৃথ개별 kernel로 실행되던 단계를 하나의 kernel에 결합하는 방식입니다. 중간 tensor를 HBM에 반복해서 기록하고 읽는 과정을 줄여 산술 연산보다 메모리 이동과 kernel launch가 병목인 MoE 양자화에서 효과를 냅니다.
Triton kernel fusion
Triton kernel fusion은 absmax 계산, scale 산출, clipping, FP8 변환처럼 পৃথ개별 kernel로 실행되던 단계를 하나의 kernel에 결합하는 방식입니다. 중간 tensor를 HBM에 반복해서 기록하고 읽는 과정을 줄여 산술 연산보다 메모리 이동과 kernel launch가 병목인 MoE 양자화에서 효과를 냅니다.