본문으로 건너뛰기
HF Daily Papers조회 1

SAS로 언어 모델링 손실을 활용한 Attention 희소화

SAS는 Attention 내부에 정규화된 연속 Log Gate를 삽입해 언어 모델링 손실로 Context Block 순위를 직접 학습합니다.

용어 해설

Attention 희소화(Attention Sparsification)
각 Query가 전체 Context Token을 읽지 않고 일부 Token 또는 Block만 선택해 Attention을 계산하는 기법입니다. 시퀀스 길이에 따른 누적 Attention 비용을 줄이지만, 제한된 예산 안에서 어떤 Context를 남길지 결정하는 선택 품질이 성능을 좌우합니다.
Top-K 선택(Top-K Selection)
Selector가 계산한 중요도 점수에서 상위 K개의 Context Block만 고르는 방식입니다. 선택 집합이 점수 변화에 따라 불연속적으로 바뀌므로, 일반적인 Hard Top-K 경로에서는 언어 모델링 손실의 Gradient가 Selector까지 직접 전달되지 않습니다.
로그 공간 게이트(Log-space Gate)
Selector 점수에서 만든 Gate를 Attention Logit에 log 형태로 더하는 방식입니다. Attention Softmax 내부에서 Block별 확률 질량을 직접 조절하므로, Value를 사후에 단순히 축소하는 방식보다 Context 간 상대적 우선순위를 학습하기에 적합합니다.
FlashAttention
Attention 행렬 전체를 메모리에 저장하지 않고 Tile 단위의 온라인 Softmax로 Query-Key와 Value 연산을 처리하는 메모리 효율적 Attention 구현입니다. SAS는 여기에 Block별 Log Gate와 선택 Mask를 결합한 Kernel을 추가합니다.
KV Cache
Autoregressive 생성에서 이전 Token의 Key와 Value를 저장해 다음 Query가 재사용하는 메모리 구조입니다. 긴 Context에서는 매 Decode 단계마다 전체 Cache를 읽는 비용이 커지므로, SAS는 선택된 KV Block만 읽어 비용을 줄입니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 11.수집 2026. 09. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.