FlashKDA
FlashKDA는 Kimi 프로젝트에서 공개한 Kimi Delta Attention 커널로, 대규모·긴 컨텍스트에서의 어텐션 연산을 최적화하기 위해 설계된 저수준 연산 라이브러리이다. 커널 수준 최적화로 어텐션 메모리 액세스와 계산 병목을 줄이고 MoE 특유의 통신 패턴과 결합해 추론·서빙 성능을 개선하려는 목적이 있다. 커널 구현과 하드웨어 최적화는 1M-token 컨텍스트처럼 극단적 길이에서 실무적 가능성을 좌우한다.