본문으로 건너뛰기

multi-head-latent-attention

Multi-head Latent Attention

Key와 Value 상태를 저차원 latent 표현으로 압축해 Autoregressive 추론에서 저장해야 하는 KV cache를 줄이는 Attention 구조입니다. Motif 3에서는 이 압축 표현을 한 번 정규화하고 여러 KV head로 확장해 Signal·Noise 경로가 공유합니다.