본문으로 건너뛰기
HF Daily Papers조회 1

계층적 랜드마크 희소 어텐션(HiLS-Attention): 무한 컨텍스트 모델링을 향한 접근

HiLS-Attention은 랜드마크 기반의 학습 가능한 청크 요약과 계층적 소프트맥스를 통해 청크 선택을 LM 손실로 종단간 학습시키며 8K 학습으로 4M까지 90% 이상의 검색 정확도와 대폭 낮은 추론 지연을 달성했다.

용어 해설

청크 단위 희소 어텐션(Chunk-wise Sparse Attention)
전체 시퀀스를 일정 길이의 청크로 분할하고 각 쿼리가 모든 토큰 대신 일부 청크만 선택해 어텐션을 수행하는 방식이다. 선택된 청크들에만 KV를 로드해 계산과 메모리 비용을 고정 예산으로 유지하며 긴 컨텍스트를 처리할 수 있게 한다. 청크 선택의 정확도가 성능과 extrapolation에 직접적인 영향을 미친다.
랜드마크 토큰(Landmark Token)
각 청크에 추가되는 특수 토큰으로서 해당 청크의 요약 표현을 생성하기 위해 쿼리 역할을 수행한다. 이 토큰으로부터 계산된 요약 키와 엔트로피 편향이 청크 수준의 중요도 점수를 추정하는 핵심 입력이 된다. 학습 중 LM 손실로 역전파되어 청크 선택을 종단간으로 최적화할 수 있게 한다.
LogSumExp 선형 근사(LogSumExp Linearization)
토큰 수준의 exp(로그잇) 합으로 정의되는 청크 질량의 로그를 1차 테일러 전개를 통해 쿼리·압축 키 내적과 엔트로피 편향의 합으로 근사하는 수학적 표현이다. 이 표현은 청크 질량을 상수 비용으로 추정할 수 있게 하여 정확한 청크 선택을 가능하게 한다. 근사항은 청크 요약 키와 편향항으로 계산되어 학습 가능한 파라미터로 처리된다.
계층적 소프트맥스(Hierarchical Softmax)
전체 어텐션을 먼저 청크 단위의 inter-chunk 소프트맥스와 각 청크 내부의 intra-chunk 소프트맥스 두 단계로 인자분해하는 방식이다. inter-chunk 항은 학습된 청크 질량 대리변수로 치환되어 청크 선택이 포워드 패스에 영향을 미치게 설계된다. 이 구조로 인해 LM 손실이 청크 요약과 선택 점수로 직접 전파되어 종단간 학습이 가능해진다.
저계수 쿼리 보정(Low-Rank Query Calibration)
토큰 수준 쿼리와 압축된 청크 키의 표현 차이를 줄이기 위해 추가되는 저랭크 어댑터이다. 입력 숨김 상태에 대해 up/down 프로젝션을 통해 쿼리를 보정하여 청크 질량 대리변수의 정확도를 개선한다. 모델 크기에 비해 경량이며 길이 외삽 성능과 퍼플렉시티 개선에 기여한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 03.수집 2026. 07. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.