본문으로 건너뛰기

jagged-flash-attention

Jagged Flash Attention

비정형 시퀀스 길이를 가진 추천 데이터에 맞춰 메모리 접근과 연산을 최적화한 어텐션 커널로, 패딩 비용을 줄이고 GPU 캐시·메모리 활용을 개선한다. 추천 워크로드의 희소성·가변 길이 특성에서 연산 효율을 끌어올릴 때 사용된다.