용어 해설
- 키-값 캐시(KV Cache)
- — Transformer 계열 모델에서 디코딩 중에 각 토큰의 key·value 벡터를 저장해 다음 토큰 예측에 재사용하는 구조로, 컨텍스트 길이에 따라 메모리 사용량이 선형으로 증가해 장문 입력 처리에서 병목이 된다.
- 시맨틱 스팬(Semantic Span)
- — 문맥을 의미적으로 일관된 구간으로 분할한 단위로, 토큰 서프라이절(확률 기반 경계)로 경계가 정해지면 정보 밀도가 높은 구간을 더 촘촘히 보존하고 낮은 밀도 구간은 더 공격적으로 압축할 수 있다.
- 저계수 SVD(Low-rank SVD)
- — 스팬 내 토큰 키·값 행렬에 대해 특이값 분해를 수행한 뒤 소수 성분만 보존하여 토큰 수준의 구조를 압축하는 방식으로, CPU에 보관된 저계수 인수분해로부터 필요한 성분만 GPU로 전송해 재구성한다.
- 토큰 서프라이절(Token Surprisal)
- — prefill 단계에서 모델이 계산하는 각 토큰의 음의 로그 확률로, 높은 값이 주제 변화나 엔티티 도입처럼 의미적 경계를 나타내는 지표로 활용되어 스팬 분할 기준으로 사용된다.
- 줌인 메커니즘(Zoom-In Mechanism)
- — 디코딩 시점에 쿼리와 스팬 요약 벡터 간 라우팅 점수로 관련 스팬을 선택하고 CPU에 저장된 저계수 성분을 비동기 전송해 선택된 스팬을 토큰 수준으로 재구성하는 동적 확장 정책이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




