용어 해설
- 청크 단위 희소 어텐션(Chunk-wise Sparse Attention)
- — 전체 시퀀스를 일정 길이의 청크로 분할하고 각 쿼리가 모든 토큰 대신 일부 청크만 선택해 어텐션을 수행하는 방식이다. 선택된 청크들에만 KV를 로드해 계산과 메모리 비용을 고정 예산으로 유지하며 긴 컨텍스트를 처리할 수 있게 한다. 청크 선택의 정확도가 성능과 extrapolation에 직접적인 영향을 미친다.
- 랜드마크 토큰(Landmark Token)
- — 각 청크에 추가되는 특수 토큰으로서 해당 청크의 요약 표현을 생성하기 위해 쿼리 역할을 수행한다. 이 토큰으로부터 계산된 요약 키와 엔트로피 편향이 청크 수준의 중요도 점수를 추정하는 핵심 입력이 된다. 학습 중 LM 손실로 역전파되어 청크 선택을 종단간으로 최적화할 수 있게 한다.
- LogSumExp 선형 근사(LogSumExp Linearization)
- — 토큰 수준의 exp(로그잇) 합으로 정의되는 청크 질량의 로그를 1차 테일러 전개를 통해 쿼리·압축 키 내적과 엔트로피 편향의 합으로 근사하는 수학적 표현이다. 이 표현은 청크 질량을 상수 비용으로 추정할 수 있게 하여 정확한 청크 선택을 가능하게 한다. 근사항은 청크 요약 키와 편향항으로 계산되어 학습 가능한 파라미터로 처리된다.
- 계층적 소프트맥스(Hierarchical Softmax)
- — 전체 어텐션을 먼저 청크 단위의 inter-chunk 소프트맥스와 각 청크 내부의 intra-chunk 소프트맥스 두 단계로 인자분해하는 방식이다. inter-chunk 항은 학습된 청크 질량 대리변수로 치환되어 청크 선택이 포워드 패스에 영향을 미치게 설계된다. 이 구조로 인해 LM 손실이 청크 요약과 선택 점수로 직접 전파되어 종단간 학습이 가능해진다.
- 저계수 쿼리 보정(Low-Rank Query Calibration)
- — 토큰 수준 쿼리와 압축된 청크 키의 표현 차이를 줄이기 위해 추가되는 저랭크 어댑터이다. 입력 숨김 상태에 대해 up/down 프로젝션을 통해 쿼리를 보정하여 청크 질량 대리변수의 정확도를 개선한다. 모델 크기에 비해 경량이며 길이 외삽 성능과 퍼플렉시티 개선에 기여한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.






