용어 해설
- Mamba-2
- — Mamba-2는 순환 상태를 이용해 시퀀스 혼합을 수행하는 레이어 설계로, 전체 어텐션의 N² 연산을 피하고 상태 크기를 고정시켜 긴 문맥에서의 메모리·추론 비용을 낮춘다. 이 논문에서는 주로 시퀀스 혼합을 Mamba-2가 담당하여 KV 캐시 증가를 억제하는 역할을 했다.
- 그룹드-쿼리 어텐션(Grouped-Query Attention)
- — Grouped-Query Attention은 키·값 헤드를 소수로 제한하고 쿼리 헤드를 그룹화해 어텐션 상태의 메모리 증가를 줄이는 방법으로, KV 캐시의 토큰당 크기를 축소하여 긴 컨텍스트 추론에서 메모리 대역폭 부담을 줄인다.
- 혼합 전문가(MoE)(Mixture-of-Experts (MoE))
- — Mixture-of-Experts는 전체 파라미터 중 일부 전문가만 토큰 단위로 활성화하는 라우팅 기법으로, 총 용량을 키우면서 토큰당 활성 파라미터를 작게 유지해 추론 비용 대비 표현력을 개선한다. Soofi S는 MoE 레이어로 활성 파라미터를 3B 수준으로 유지했다.
- 키-값 캐시(KV cache)
- — KV 캐시는 디코딩 중 어텐션을 위해 과거 토큰의 키·값을 저장하는 구조로, 문맥 길이가 늘어나면 토큰당 저장 공간과 읽기 비용이 선형으로 증가하여 긴 컨텍스트에서 처리량 저하를 유발한다. Soofi S는 KV 캐시를 소수 레이어에만 유지해 이 비용을 최소화했다.
- Warmup–Stable–Decay 학습률 스케줄(Warmup–Stable–Decay (WSD))
- — WSD는 초기 선형 워밍업, 장기간의 안정 구간, 이후 감쇠(decay)를 순차 적용하는 학습률 스케줄로, 초반에는 폭넓은 데이터에 노출하고 감쇠 구간에서 고품질 데이터에 집중시키는 커리큘럼 설계에 유리하다. 논문에서는 20T 토큰 지점에서 decay를 시작했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.







