블록 단위 어텐션
토큰들을 고정 크기 블록으로 나누고 각 블록 내부에서만 dense 어텐션을 수행하는 접근법이다. 내부 연산은 완전한 self-attention을 유지하되 블록 간 장기 의존성은 요약된 메모리로 전달해 전역 연산 비용을 줄인다. 긴 문맥을 처리할 때 계산량과 메모리 사용량을 줄이는 것이 목적이다.