본문으로 건너뛰기

상태-예측 분리 가설과 State-Prediction Separation Transformer

Transformer 계열 모델은 각 시점의 활성화가 즉시 다음 토큰 예측과 이후 토큰을 위한 상태 보관이라는 두 역할을 동시에 수행하면서 역할이 충돌할 가능성이 존재한다. 이 논문은 예측과 상태 준비를 구조적으로 분리하면 동일한 파라미터 수에서 더 낮은 검증 NLL과 더 나은 제로샷 성능을 얻는다는 점을 실험으로 입증했다. 데이터가 희소해지는 상황에서 토큰당 학습 효율을 올리는 방식은 사전학습 비용과 데이터 예산을 보다 효율적으로 활용하게 한다.

용어 해설

키-값 캐시(KV cache)
Transformer가 과거 토큰의 key와 value를 저장하여 이후 토큰의 attention 연산에서 재사용하는 메커니즘이다. 이 캐시는 생성 과정에서 과거의 표현을 빠르게 참조하도록 하여 문맥 유지와 속도 향상에 기여한다. 본문에서는 어떤 스트림의 KV 항목을 지속적으로 보존하느냐가 성능과 데이터 효율성에 결정적 영향을 미치는 요소로 다뤄진다.
슬라이딩 윈도우(Sliding window)
모델이 최근 몇 개의 예측용 토큰만 일시적으로 참조하도록 키-값 저장을 제한하는 기법이다. 본문에서는 <predict> 항목을 윈도우 크기 w 이내에서만 참조하도록 하여 예측 스트림을 비지속적(ephemeral)으로 유지한다. 이 방식은 persistent state 크기를 일정 수준으로 유지하면서 지역적 일관성을 보장하는 수단이다.
<predict> 토큰(<predict> token)
입력 토큰마다 삽입되는 학습 가능한 더미 토큰으로서 바로 다음 토큰의 예측만 담당하도록 설계된 슬롯이다. 이 토큰의 활성화는 짧은 윈도우 동안만 KV 캐시에 남고 이후 폐기되어 예측 역할과 상태 저장 역할을 분리하는 핵심 수단이 된다. 논문에서는 이 토큰을 통해 예측 스트림과 상태 스트림을 구분하여 gradient 흐름을 분리한다.
미래 손실 그라디언트(Future-loss gradient)
어떤 위치의 파라미터가 이후 시점 j>i 의 손실 ℓ_j 에 기여할 때 생기는 기울기 성분을 지칭한다. 본문은 이 성분이 어느 스트림으로 얼마나 배분되는지가 모델의 상태 표현과 예측 성능에 직접적인 영향을 준다고 분석한다. SPS는 이 미래 손실 그라디언트를 입력 스트림에 더 많이 모으는 것으로 확인됐다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 01.수집 2026. 07. 03.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.