본문으로 건너뛰기

Sparse Delta Memory: 희소성으로 선형 RNN의 상태 용량 확장

Sparse Delta Memory(SDM)는 Gated DeltaNet의 밀집 상태 업데이트를 희소화하여 동일 FLOPs와 파라미터 예산에서 상태 용량을 대폭 확장하고 긴 문맥 리콜과 in‑context 학습 성능을 향상시켰다.

용어 해설

선형 어텐션(Linear Attention)
선형 어텐션은 키와 쿼리에 대한 특징 매핑을 통해 외적을 누적하는 방식으로 메모리를 유지하여 시퀀스 길이에 관계없이 토큰 당 계산량을 일정하게 유지하는 방법이다. 이 방식은 메모리와 FLOPs가 입력 길이에 대해 선형으로 증가하는 softmax 어텐션과 달리 고정된 상태 벡터로 긴 문맥을 처리할 수 있다. 본 논문에서는 선형 어텐션 구조의 상태 크기 한계를 극복하는 것이 핵심 목표이다.
제품-키 메모리(Product-Key Memory)
Product-Key Memory는 두 개의 저차원 점수 벡터의 외합(outer-sum)으로 대규모 메모리 인덱스에 대한 점수를 생성하고 top-k 연산만으로 희소 인덱싱을 수행하여 전체 슬롯을 물리화하지 않고도 큰 메모리를 효율적으로 접근하는 기법이다. 외합의 top-k 성질을 이용하면 계산 복잡도를 √N×d + k^2 수준으로 줄일 수 있다. SDM은 이 인덱싱 스킴을 읽기/쓰기 선택에 적용한다.
게이티드 델타넷(Gated DeltaNet)
Gated DeltaNet은 쓰기 전 기존 연관값을 회수하여 차분(delta)만 갱신하는 규칙과 시간 감쇠(forget) 게이트를 도입해 메모리 간섭을 억제하고 상태 정규화를 유지하는 선형 RNN 계열의 구조이다. 각 타임스텝에서 상태는 감쇠와 입력 게이트로 제어되는 델타 업데이트를 받아 갱신된다. SDM은 이 GDN의 업데이트 규칙을 슬롯별 희소 갱신으로 확장했다.
isoFLOP 설계(isoFLOP)
isoFLOP 설계는 비교 대상 모델들과 동일한 FLOPs 예산과 동일한 수의 파라미터를 유지하도록 구조를 설계하여 성능 차이가 계산 예산이 아닌 모델 구조적 차이(예: 상태 용량)에서 비롯되는지를 고립해서 평가하는 실험 설정이다. 본 논문은 SDM과 GDN을 isoFLOP 조건으로 비교하였다. 이로써 메모리 용량 증가가 성능 개선의 주 원인임이 확인되었다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 08.수집 2026. 07. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.