본문으로 건너뛰기

FlyDSL

FlyDSL

FlyDSL은 AMD GPU에서 instruction scheduling과 software pipelining을 세밀하게 제어하는 kernel 프로그래밍 계층입니다. DeepSeek-V4-Flash의 sparse-MLA attention에서는 KV gather 지연을 MFMA 연산과 겹치도록 serial QK·softmax·PV 경로를 조정하고, MegaMoE에서는 통신과 GEMM을 instruction 수준에서 교차 처리합니다. Primus의 측정에서 FlyDSL attention은 Triton보다 CSA forward와 backward 지연을 크게 줄였고, MegaMoE fused kernel의 기반이 됐습니다.