본문으로 건너뛰기

HISA: 세밀한 희소 어텐션을 위한 효율적인 계층적 인덱싱

긴 문맥을 처리할 때 어텐션 연산 자체보다 '어떤 토큰이 중요한지'를 찾아내는 인덱싱 과정이 새로운 병목 현상이 되고 있다. HISA는 이 과정을 계층화하여 연산량을 대폭 줄이면서도 기존 모델의 정확도를 그대로 유지하는 실용적인 해결책을 제시한다.

용어 해설

희소 어텐션(Sparse Attention)
모든 토큰 쌍의 관계를 계산하는 대신, 쿼리와 가장 관련성이 높은 일부 토큰만 선택하여 어텐션을 수행하는 기법이다. 연산량과 메모리 사용량을 줄여 긴 문맥 처리를 가능하게 한다.
인덱서(Indexer)
희소 어텐션 구조에서 각 쿼리에 대해 어떤 토큰이 가장 중요한지 점수를 매겨 선택하는 경량 모듈이다. 전체 문맥을 스캔해야 하므로 시퀀스가 길어질수록 새로운 병목 구간이 된다.
평균 풀링(Mean Pooling)
특정 영역 내의 여러 벡터 값을 평균 내어 하나의 대표 벡터로 압축하는 연산이다. 데이터의 전반적인 특징을 유지하면서 차원을 축소하거나 정보를 요약할 때 사용된다.
교집합 대비 합집합 비율(IoU (Intersection over Union))
두 집합이 얼마나 유사한지 측정하는 지표로, 두 집합의 교집합 크기를 합집합 크기로 나눈 값이다. 1에 가까울수록 두 집합이 거의 동일함을 의미하며, 여기서는 토큰 선택의 일관성을 평가하는 데 쓰인다.
다중 헤드 잠재 어텐션(MLA (Multi-head Latent Attention))
DeepSeek 모델에서 사용되는 효율적인 어텐션 구조로, KV 캐시의 압축된 잠재 표현을 사용하여 메모리 효율성을 극대화한다. HISA는 이 구조의 상단 인덱싱 과정을 최적화한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 30.수집 2026. 04. 01.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.