cute-kernel
CuTe 융합 커널
CuTe 커널은 Inclusion–Exclusion Merge의 세 FlashAttention 호출과 LogSumExp 병합을 단일 CUDA 커널로 융합한 구현체로, prefill과 토큰 생성 시의 오버헤드를 최소화한다. 융합된 커널은 H100에서 FA2 대비 prefill에서 최대 1.39×, 생성에서는 ≤4% 오버헤드를 목표로 성능을 회복한다. Jet-Long의 실용적 효율성은 이 커널로 인해 현실화된다.