TL;DR
TUPOI는 dense Attention과 persistent KV-cache 대신 (q, p) Hamiltonian phase state와 Velocity-Verlet 적분을 사용하는 post-Transformer 언어 모델이다. TinyStories 10,000스텝 비교에서 TUPOI-300M은 304.2M parameters와 perplexity 46.39를 기록해 355.0M Transformer baseline의 50.80보다 낮은 값을 보였다. 자동회귀 상태는 6.00KB로 고정돼 65,536토큰에서 6.00GB와 CUDA OOM에 도달한 Transformer KV-cache와 대조된다. Tesla T4의 8,192토큰 forward-pass에서도 peak VRAM은 1,805.4MB로 baseline의 2,272.9MB보다 20.6% 낮았다. 다만 128k 초과 문맥, 1B 이상 모델 규모, GSM8k와 MetaMathQA 기반 downstream 평가는 아직 추가 검증이 필요하다.
섹션별 상세


git clone https://github.com/narelabs/TUPOI.git
cd TUPOI
pip install -r requirements.txtTUPOI 저장소를 내려받고 의존성을 설치하는 재현 절차다.
python scripts/generate_cli.py대화형 텍스트 생성 CLI를 실행하는 명령이다.
python benchmarks/benchmark_vram.py하드웨어 VRAM 벤치마크를 실행하는 명령이다.
python scripts/plot_benchmarks.py
python scripts/generate_dual_axis_charts.py벤치마크 시각화를 생성하는 명령이다.


용어 해설
- 심플렉틱 적분기(Symplectic Integrator)
- — Hamiltonian 동역학의 상태를 시간 단계별로 갱신하면서 위상공간의 구조와 부피를 보존하는 수치 계산 방식이다. TUPOI는 Velocity-Verlet 방식으로 위치와 운동량을 번갈아 갱신해 장거리 시퀀스 처리에서 상태 소실을 줄이는 핵심 구조로 사용한다.
- Velocity-Verlet
- — 운동량을 시간 간격의 절반만큼 먼저 갱신한 뒤 위치를 갱신하고, 새 위치에서 운동량을 다시 갱신하는 Leapfrog 계열 적분법이다. TUPOI의 24개 레이어가 위상 상태를 전파하는 과정에 사용된다.
- KV-cache
- — Transformer가 이전 토큰의 Key와 Value를 저장해 다음 토큰 생성에서 재계산을 피하는 메모리 구조다. 저장 항목이 시퀀스 길이에 비례해 늘어나므로 긴 문맥에서는 O(N) 상태 메모리와 CUDA 메모리 부족을 일으킬 수 있다.
- Liouville 정리(Liouville's Theorem)
- — Hamiltonian 흐름이 위상공간의 부피를 보존한다는 정리다. TUPOI는 이 성질과 Jacobian determinant 1.000000을 근거로 순전파 과정에서 위상 상태의 정보량이 보존된다고 설명한다.
- 멱법칙 스케일링(Power-Law Scaling)
- — 모델 규모와 손실 사이의 관계를 멱법칙으로 근사해 파라미터 증가에 따른 성능 변화를 나타내는 방식이다. TinyStories 실험에서는 TUPOI 체크포인트 세 개의 검증 손실과 α = 0.113인 적합선으로 규모 확장 경향을 확인했다.
기술
- TUPOI
- Transformer
- GPT-2 BPE tokenizer
- Velocity-Verlet
- IgnoranceGate
- OpinionAnchor
- PyTorch
- CUDA
- Flash-Verlet CUDA kernels
- Tesla T4
활용 사례
- 긴 문맥의 자동회귀 텍스트 생성
- 고정 메모리 상태를 사용하는 스트리밍 생성
- 소비자용 하드웨어에서의 장거리 언어 모델 추론
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.