본문으로 건너뛰기

SMELT: 반복형 MoE Transformer의 계산량 대비 확장 법칙

SMELT는 중간층 절반을 두 번 실행하고 폭·전문가 수·GQA를 조정해 Baseline과 FLOPs·파라미터·KV cache를 맞추면서 학습 계산량을 6.8–18.0% 절약했습니다.

용어 해설

반복형 Transformer(Looped Transformer)
기존 Transformer 층을 새 가중치로 쌓는 대신 동일한 층 블록을 여러 번 실행하는 구조입니다. 저장하는 고유 파라미터 수를 늘리지 않고 토큰이 거치는 순차 계산 깊이를 키우지만, 반복 횟수만큼 FLOPs와 KV cache 부담이 커지므로 공정한 비교에는 비용 조정이 필요합니다.
Mixture-of-Experts
각 토큰을 전체 Feed-Forward 전문가가 아니라 일부 전문가에만 라우팅하는 구조입니다. 전체 전문가를 저장해 파라미터 용량을 확보하면서 토큰당 활성화되는 전문가 수를 제한해 계산량을 분리할 수 있어, SMELT에서는 반복 실행으로 늘어난 FLOPs와 줄어든 폭을 함께 조정하는 데 활용됩니다.
KV 캐시(KV Cache)
Autoregressive 추론에서 이미 계산한 Attention의 Key와 Value를 저장해 이전 토큰의 투영을 다시 계산하지 않게 하는 메모리 구조입니다. 캐시 크기는 레이어 수와 Head 차원에 영향을 받으므로, 반복 실행 모델의 실제 서비스 가능 문맥 길이를 비교할 때 파라미터와 FLOPs와 함께 맞춰야 합니다.
Attention Sink
토큰의 의미와 무관하게 Autoregressive Transformer가 시퀀스의 초기 토큰에 Attention 질량을 과도하게 모으는 현상입니다. SMELT에서는 같은 중간 층의 두 번째 방문이 이 질량을 낮추고 내용과 관련된 토큰으로 재분배해, 긴 입력과 In-context Learning에서의 이득과 연결됩니다.
Chinchilla 스케일링 법칙(Chinchilla Scaling Law)
모델의 계산량, 파라미터 또는 활성 계산량, 학습 토큰 수와 검증 손실 사이의 관계를 거듭제곱 형태로 근사하는 방법입니다. 총 학습 계산량을 고정하면 모델 계산과 데이터 양을 어떻게 나눌지 결정할 수 있으며, 이 논문은 Baseline과 SMELT에 별도 법칙을 맞춰 동일 손실에 필요한 계산량을 비교합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 01.수집 2026. 09. 03.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.