본문으로 건너뛰기

TUPOI의 O(1) 메모리 언어 모델 구조

TUPOI가 Attention과 KV-cache를 제거하고 6.00KB 고정 상태로 긴 문맥 생성을 시험했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

TUPOI는 dense Attention과 persistent KV-cache 대신 (q, p) Hamiltonian phase state와 Velocity-Verlet 적분을 사용하는 post-Transformer 언어 모델이다. TinyStories 10,000스텝 비교에서 TUPOI-300M은 304.2M parameters와 perplexity 46.39를 기록해 355.0M Transformer baseline의 50.80보다 낮은 값을 보였다. 자동회귀 상태는 6.00KB로 고정돼 65,536토큰에서 6.00GB와 CUDA OOM에 도달한 Transformer KV-cache와 대조된다. Tesla T4의 8,192토큰 forward-pass에서도 peak VRAM은 1,805.4MB로 baseline의 2,272.9MB보다 20.6% 낮았다. 다만 128k 초과 문맥, 1B 이상 모델 규모, GSM8k와 MetaMathQA 기반 downstream 평가는 아직 추가 검증이 필요하다.

섹션별 상세

01
TUPOI는 dense Attention 행렬과 persistent KV-cache를 제거하고, 은닉 상태를 canonical coordinates인 (q, p)로 나눠 Hamiltonian phase space에서 전파하는 post-Transformer 언어 모델이다. 24개 레이어는 Velocity-Verlet Leapfrog 순서에 따라 운동량을 반 단계 갱신하고 위치를 갱신한 뒤 운동량을 다시 갱신한다. 이 구조는 Attention의 O(N²) pairwise 계산을 대체하면서 시퀀스 상태를 고정 크기로 유지하려는 목적을 가진다.
02
TUPOI의 상태 안정화에는 IgnoranceGate와 OpinionAnchor가 함께 사용된다. IgnoranceGate는 x ⊙ σ(W_g x) 형태의 학습 가능한 sigmoid 필터로 토큰 잡음을 줄이고, OpinionAnchor는 a_t = (1−η)a_{t−1} + η · x̄' 형태의 지수이동평균으로 canonical phase attractor를 만든다. 이를 통해 생성 길이가 길어질 때 잡음이 위상 상태를 계속 흔드는 문제를 억제하려는 설계다.
03
TinyStories에서 10,000스텝 동안 동일한 seed, optimizer, token budget, parameter scale로 비교한 결과, TUPOI-300M은 304.2M active parameters와 validation loss 3.8371, perplexity 46.39를 기록했다. 355.0M 파라미터의 Transformer baseline은 loss 3.9280과 perplexity 50.80을 기록해 TUPOI보다 높은 perplexity를 보였다. TUPOI의 300M급 결과는 baseline보다 파라미터가 14% 적은 조건에서 측정됐으며, 17M과 47M 체크포인트에서도 각각 loss 4.1516과 4.1078을 기록했다.
TinyStories에서 Baseline Transformer와 TUPOI-300M의 파라미터 수와 perplexity를 함께 비교한 이중 축 막대그래프다.
ChartBaseline Transformer는 355.0M parameters와 perplexity 50.80을 기록하고, TUPOI-300M은 304.2M parameters와 perplexity 46.39를 기록한다. 그래프는 TUPOI가 더 적은 파라미터로 더 낮은 perplexity를 보였다는 README의 비교 결과를 시각화한다.
TUPOI 체크포인트의 active parameter 수와 validation loss 사이의 멱법칙 적합을 나타낸 산점도다.
ChartTUPOI-17M, TUPOI-47M, TUPOI-300M의 validation loss는 각각 4.1516, 4.1078, 3.8371로 표시되며, 점선 적합선의 지수는 α = 0.113이다. 파라미터 규모가 커질수록 손실이 낮아지는 경향과 세 체크포인트의 위치를 한 그래프에 담았다.
04
자동회귀 생성에서 Transformer의 KV-cache는 생성 토큰 수에 따라 48.00MB에서 6.00GB까지 증가하지만 TUPOI의 (q, p) phase state는 모든 구간에서 6.00KB로 유지된다. 비교 표에서는 512토큰에서 8,000배, 2,048토큰에서 32,000배, 8,192토큰에서 128,000배, 32,768토큰에서 500,000배의 메모리 차이를 기록했다. 65,536토큰에서는 Transformer가 CUDA OOM에 도달한 반면 TUPOI는 6.00KB 상태를 유지했다.
bash
git clone https://github.com/narelabs/TUPOI.git
cd TUPOI
pip install -r requirements.txt

TUPOI 저장소를 내려받고 의존성을 설치하는 재현 절차다.

bash
python scripts/generate_cli.py

대화형 텍스트 생성 CLI를 실행하는 명령이다.

bash
python benchmarks/benchmark_vram.py

하드웨어 VRAM 벤치마크를 실행하는 명령이다.

bash
python scripts/plot_benchmarks.py
python scripts/generate_dual_axis_charts.py

벤치마크 시각화를 생성하는 명령이다.

생성 문맥 길이에 따른 Transformer KV-cache와 TUPOI phase state의 메모리 증가 폭을 로그 축으로 비교한 그래프다.
ChartTransformer의 메모리 footprint는 512토큰의 약 48MB에서 64k 토큰의 6.00GB까지 증가하는 반면, TUPOI는 전 구간에서 6.00KB로 표시된다. 그래프에는 64k 토큰에서 Transformer가 6.00GB OOM limit에 도달하고 TUPOI가 1,000,000배 가볍다는 주석이 포함돼 있다.
05
Tesla T4와 FP16 기준 forward-pass 측정에서 TUPOI-300M은 512토큰부터 8,192토큰까지 Transformer baseline보다 421.7MB에서 467MB 낮은 peak VRAM을 사용했다. 8,192토큰에서는 baseline 2,272.9MB, TUPOI 1,805.4MB로 측정돼 절감률이 20.6%였다. 다만 300M 모델의 하드웨어 검증 범위는 8,192토큰까지이며, 128k보다 긴 문맥에는 전용 Flash-Verlet CUDA kernel이 필요하고 1B 이상 규모와 GSM8k, MetaMathQA 평가도 아직 진행 중이다.
8,192토큰 문맥에서 Transformer와 TUPOI-300M의 peak VRAM과 context state memory를 비교한 이중 축 막대그래프다.
ChartTransformer는 peak VRAM 2.27GB와 context state memory 768.0MB로 표시되고, TUPOI-300M은 각각 1.80GB와 6.0KB로 표시된다. 서로 다른 단위를 두 축으로 분리해 전체 VRAM 사용량과 장거리 상태 메모리의 차이를 동시에 나타낸다.

용어 해설

심플렉틱 적분기(Symplectic Integrator)
Hamiltonian 동역학의 상태를 시간 단계별로 갱신하면서 위상공간의 구조와 부피를 보존하는 수치 계산 방식이다. TUPOI는 Velocity-Verlet 방식으로 위치와 운동량을 번갈아 갱신해 장거리 시퀀스 처리에서 상태 소실을 줄이는 핵심 구조로 사용한다.
Velocity-Verlet
운동량을 시간 간격의 절반만큼 먼저 갱신한 뒤 위치를 갱신하고, 새 위치에서 운동량을 다시 갱신하는 Leapfrog 계열 적분법이다. TUPOI의 24개 레이어가 위상 상태를 전파하는 과정에 사용된다.
KV-cache
Transformer가 이전 토큰의 Key와 Value를 저장해 다음 토큰 생성에서 재계산을 피하는 메모리 구조다. 저장 항목이 시퀀스 길이에 비례해 늘어나므로 긴 문맥에서는 O(N) 상태 메모리와 CUDA 메모리 부족을 일으킬 수 있다.
Liouville 정리(Liouville's Theorem)
Hamiltonian 흐름이 위상공간의 부피를 보존한다는 정리다. TUPOI는 이 성질과 Jacobian determinant 1.000000을 근거로 순전파 과정에서 위상 상태의 정보량이 보존된다고 설명한다.
멱법칙 스케일링(Power-Law Scaling)
모델 규모와 손실 사이의 관계를 멱법칙으로 근사해 파라미터 증가에 따른 성능 변화를 나타내는 방식이다. TinyStories 실험에서는 TUPOI 체크포인트 세 개의 검증 손실과 α = 0.113인 적합선으로 규모 확장 경향을 확인했다.

기술

  • TUPOI
  • Transformer
  • GPT-2 BPE tokenizer
  • Velocity-Verlet
  • IgnoranceGate
  • OpinionAnchor
  • PyTorch
  • CUDA
  • Flash-Verlet CUDA kernels
  • Tesla T4

활용 사례

  • 긴 문맥의 자동회귀 텍스트 생성
  • 고정 메모리 상태를 사용하는 스트리밍 생성
  • 소비자용 하드웨어에서의 장거리 언어 모델 추론

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 16.수집 2026. 08. 16.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.