본문으로 건너뛰기
r/artificial조회 1

곱셈 격자: 위치 인코딩을 위한 자연스러운 산술적 기저

위치를 수직선상의 거리가 아닌 정수의 곱셈 격자 구조로 인코딩하여 모델의 문맥 안정성과 KV 캐시 압축 효율을 획기적으로 개선했다.

실용적 조언

  • Llama 3.2 1B 모델 등에 소수 주파수 블렌딩(alpha 0.15-0.20)을 적용하면 재학습 없이도 PPL 개선이 가능하다.
  • KV 캐시 압축 시 K 벡터에는 Walsh-Hadamard 변환 후 대역별 차등 비트 할당(5/5/4/3)을, V 벡터에는 평탄한 3비트 양자화를 적용하는 것이 최적이다.
  • 압축 시 head_dim 전체를 변환 단위로 설정해야 하며, 일부만 샘플링할 경우 품질이 급격히 저하되므로 주의해야 한다.

섹션별 상세

01
기존 위치 인코딩의 한계와 곱셈 격자 가설에 대해 논의했다. 위치를 수직선상의 거리로만 보는 기존 관점이 RoPE와 ALiBi 간의 트레이드오프를 만든다고 진단했다. 정수를 소인수분해 기반의 곱셈 격자 내 좌표로 인코딩하면 상대적 위치 불변성과 장기 문맥 안정성을 동시에 확보할 수 있다. 언어의 Zipf 법칙과 리만 제타 함수의 관계를 통해 소수 조화 구조가 자연스러운 스펙트럼 기저임을 수학적으로 도출했다.
02
SpectralRoPEALiBi 아키텍처와 성능을 검증했다. 소수 기반 회전과 학습 가능한 ALiBi 거리 편향을 결합하여 새로운 어텐션 스코어 계산 방식을 도입했다. 300M 파라미터 모델 실험에서 ALiBi 대비 PPL을 108.7에서 106.6으로 개선했으며, 512에서 8,192 토큰에 이르는 모든 문맥 길이에서 우위를 점했다. 이는 위치를 산술적 정체성으로 다루는 것이 단순 거리 기반 접근보다 효과적임을 입증한다.
03
ZetaZeroPredictor를 통한 메커니즘 검증을 수행했다. 리만 제타 제로 간격을 예측하는 실험에서 기하학적 RoPE는 발산한 반면, 격자 정렬 PE는 안정적인 수렴(r=0.81~0.86)을 보였다. 기하학적 주파수는 제타 제로가 존재하는 수학적 공간을 표상하지 못하지만, 격자 기반 주파수는 이를 직접적으로 표현할 수 있는 기저 벡터를 제공한다. 이 결과는 제타 함수의 산술적 구조와 언어의 위치 구조 사이의 깊은 연관성을 시사한다.
04
VHT2 대역별 양자화를 통한 KV 캐시 압축 방안을 제시했다. K 벡터는 RoPE의 영향으로 Walsh-Hadamard 공간에서 강한 스펙트럼 집중도를 보이지만, V 벡터는 균일한 에너지 분포를 가진다는 구조적 비대칭성을 발견했다. K에는 5/5/4/3 비트 할당을, V에는 평탄한 3비트 양자화를 적용하여 Qwen3-8B 모델에서 품질 저하를 1.24%로 억제하면서 3.8배의 압축률을 달성했다. 이는 위치 정보가 포함된 K 벡터의 특성을 활용한 최적의 압축 전략을 보여준다.

용어 해설

곱셈 격자(Multiplicative Lattice)
정수를 소인수분해를 통해 고유한 좌표로 정의하는 수학적 구조이다. 모든 정수는 소수라는 기저 벡터들의 조합으로 표현되며, 이를 통해 숫자 간의 산술적 관계(공약수, 조화 공명 등)를 인코딩할 수 있다. 위치 인코딩에서 단순 거리가 아닌 수의 내재적 구조를 반영하는 핵심 개념이다.
월시-하다마르 변환(Walsh-Hadamard Transform)
신호를 상호 직교하는 Walsh 함수들의 합으로 변환하는 이산 직교 변환 기법이다. 본문에서는 KV 캐시의 K 벡터가 가진 스펙트럼 집중도를 분석하고 압축하기 위한 도구로 사용된다. RoPE가 적용된 벡터의 구조적 특징을 추출하여 효율적인 비트 할당을 가능하게 한다.
제타 제로(Zeta Zeros)
리만 제타 함수가 0이 되는 지점들로, 소수의 분포와 밀접한 관련이 있는 수학적 대상이다. 본문에서는 언어의 통계적 특성(Zipf 법칙)이 제타 함수와 연결되어 있으며, 제타 제로의 구조를 학습하는 능력이 위치 인코딩의 효율성을 측정하는 척도로 활용된다.
KV 캐시 압축(KV Cache Compression)
Transformer 모델의 추론 과정에서 생성된 Key와 Value 벡터들을 저장하는 메모리 공간을 줄이는 기술이다. 본문에서는 K 벡터의 위치 정보 구조와 V 벡터의 내용 정보 구조가 다르다는 점을 이용해 대역별 양자화(Banded Quantization)를 적용하여 압축 효율을 극대화했다.

언급된 도구

llama.cpp추천

추론 엔진 및 VHT2 압축 구현체

Qwen3-8B중립

VHT2 압축 벤치마크 대상 모델

언급된 리소스

문서VHT2 Banded KV Cache Compression Research Results
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 07.수집 2026. 04. 07.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.