본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
Group Query Attention(GQA)의 작동 원리와 설계 의도
Grouped Query Experts (GQE): GQA Self-Attention 내부의 Mixture-of-Experts
현대 LLM의 어텐션 변체 시각적 가이드: MHA, GQA에서 MLA 및 하이브리드 아키텍처까지
하드웨어-적응형 대형 언어 모델 디코딩을 위한 Group-Query Latent Attention(GQLA)
LLM에서 희소성이 깊이의 저주를 완화하는 시점
FlashAttention을 능가하는 Triton 커널: 40배 빠른 속도와 90% VRAM 절감 달성
← 피드로 돌아가기
GQA
Architecture (AI 아키텍처)
약 6개 아티클
관련 태그:
DeepSeek
Flash Attention
GQA Self-Attention
Grouped-Query Attention
Grouped Query Experts (GQE)
MLA
MoE
Multi-head Latent Attention
Transformer
Triton