압축 어텐션
Compressed Attention은 모델의 전체 시퀀스 어텐션을 완전하게 저장하지 않고 구조적·압축적 표현으로 대체해 메모리 사용을 줄이는 방법으로, 논문에서는 GLM-5.2의 혼합전문가 구조와 함께 대규모 컨텍스트 실행을 가능하게 하는 요소로 작동한다.