본문으로 건너뛰기
HF Daily Papers조회 2

StateSMix: Mamba 상태 공간 모델과 희소 N-gram 컨텍스트 믹싱을 통한 온라인 무손실 압축

수억 개의 파라미터를 가진 거대 모델이나 GPU 없이도, 압축 과정 중에 실시간으로 학습하는 가벼운 Mamba 모델이 기존의 강력한 압축 도구인 xz보다 더 높은 압축률을 기록했습니다. 이는 특정 데이터에 즉각적으로 적응하는 온라인 학습 모델이 범용 압축 분야에서 실질적인 경쟁력을 가질 수 있음을 보여줍니다.

용어 해설

상태 공간 모델(State Space Model)
시퀀스 데이터를 처리하기 위해 입력, 상태, 출력 사이의 선형 미분 방정식을 사용하는 아키텍처입니다. RNN의 재귀적 특성과 CNN의 병렬 학습 가능성을 결합하여 긴 시퀀스에서도 선형적인 연산 복잡도를 유지하며 효율적인 정보 유지가 가능합니다.
산술 부호화(Arithmetic Coding)
데이터의 각 심볼에 확률 구간을 할당하고 전체 메시지를 하나의 실수 범위로 표현하는 무손실 압축 기법입니다. 심볼의 발생 확률이 높을수록 더 넓은 구간을 할당하여 적은 비트로 표현함으로써 엔트로피 한계에 가까운 압축률을 달성합니다.
엔그램(N-gram)
텍스트 시퀀스에서 연속된 n개의 아이템(토큰 또는 문자)의 묶음을 의미합니다. 이전 n-1개의 토큰을 바탕으로 다음 토큰이 나타날 확률을 예측하는 통계적 모델링에 주로 사용되며, 로컬 패턴을 기억하는 데 매우 효과적입니다.
온라인 학습(Online Learning)
데이터가 순차적으로 들어올 때마다 모델을 실시간으로 업데이트하는 학습 방식입니다. 별도의 사전 학습 데이터 없이 현재 처리 중인 데이터의 특성에 즉각적으로 적응할 수 있어, 특정 파일의 고유한 패턴을 파악하는 압축 작업에 유리합니다.
로짓 바이어스(Logit Bias)
모델이 출력하는 확률 분포의 이전 단계인 로짓 값에 특정 수치를 더하거나 빼서 특정 토큰의 선택 확률을 인위적으로 조정하는 기법입니다. 본 논문에서는 n-gram 모델의 예측 결과를 SSM의 결과와 결합하는 용도로 사용됩니다.

코드 예제

python
niter = {
    8 chunks 1-10,
    4 chunks 11-30,
    2 chunks 31 +
}

학습 초기 단계에서 모델을 빠르게 수렴시키기 위해 적용된 Adam 최적화 반복 횟수 스케줄링 예시

text
delta_j = lambda * log(1 + c_j / alpha), c_j > 0

n-gram 카운트 정보를 기반으로 로짓 바이어스 값을 계산하는 수식

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 05.수집 2026. 05. 07.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.