본문으로 건너뛰기
MLA
멀티 헤드 잠재 어텐션
KV 캐시 메모리 사용량을 줄이기 위해 키와 값 벡터를 저차원 잠재 공간으로 압축했다가 추론 시 복원하는 효율적인 어텐션 기법이다.
비슷한 개념
Multi-head Latent Attention (MLA)
CCA
MLA (Multi-head Latent Attention)
KV-cache Attention
Multi-Query Attention
KV Caching
KV Quantization
KV Compaction
← 용어 사전 전체 보기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필