본문으로 건너뛰기

MLA

멀티 헤드 잠재 어텐션

KV 캐시 메모리 사용량을 줄이기 위해 키와 값 벡터를 저차원 잠재 공간으로 압축했다가 추론 시 복원하는 효율적인 어텐션 기법이다.