용어 해설
- 키-값 캐시(KV cache)
- — Transformer가 과거 토큰의 key와 value를 저장하여 이후 토큰의 attention 연산에서 재사용하는 메커니즘이다. 이 캐시는 생성 과정에서 과거의 표현을 빠르게 참조하도록 하여 문맥 유지와 속도 향상에 기여한다. 본문에서는 어떤 스트림의 KV 항목을 지속적으로 보존하느냐가 성능과 데이터 효율성에 결정적 영향을 미치는 요소로 다뤄진다.
- 슬라이딩 윈도우(Sliding window)
- — 모델이 최근 몇 개의 예측용 토큰만 일시적으로 참조하도록 키-값 저장을 제한하는 기법이다. 본문에서는 <predict> 항목을 윈도우 크기 w 이내에서만 참조하도록 하여 예측 스트림을 비지속적(ephemeral)으로 유지한다. 이 방식은 persistent state 크기를 일정 수준으로 유지하면서 지역적 일관성을 보장하는 수단이다.
- <predict> 토큰(<predict> token)
- — 입력 토큰마다 삽입되는 학습 가능한 더미 토큰으로서 바로 다음 토큰의 예측만 담당하도록 설계된 슬롯이다. 이 토큰의 활성화는 짧은 윈도우 동안만 KV 캐시에 남고 이후 폐기되어 예측 역할과 상태 저장 역할을 분리하는 핵심 수단이 된다. 논문에서는 이 토큰을 통해 예측 스트림과 상태 스트림을 구분하여 gradient 흐름을 분리한다.
- 미래 손실 그라디언트(Future-loss gradient)
- — 어떤 위치의 파라미터가 이후 시점 j>i 의 손실 ℓ_j 에 기여할 때 생기는 기울기 성분을 지칭한다. 본문은 이 성분이 어느 스트림으로 얼마나 배분되는지가 모델의 상태 표현과 예측 성능에 직접적인 영향을 준다고 분석한다. SPS는 이 미래 손실 그라디언트를 입력 스트림에 더 많이 모으는 것으로 확인됐다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


