TL;DR
Soofi S는 주권적 인프라에서 공개 가능한 모든 학습 산출물을 함께 공개하면서 긴 문맥과 고동시성 환경에서의 실제 추론 비용 문제를 모델 설계 수준에서 해결한 사례이다. 이 접근은 같은 활성 파라미터 예산으로도 긴 컨텍스트에서의 처리량을 크게 개선하고 독일어에 특화된 데이터 배분을 통해 지역적 능력을 끌어올린다는 점에서 배포성과 재현성 요구를 동시에 충족한다.
왜 중요한가
Soofi S는 주권적 인프라에서 공개 가능한 모든 학습 산출물을 함께 공개하면서 긴 문맥과 고동시성 환경에서의 실제 추론 비용 문제를 모델 설계 수준에서 해결한 사례이다. 이 접근은 같은 활성 파라미터 예산으로도 긴 컨텍스트에서의 처리량을 크게 개선하고 독일어에 특화된 데이터 배분을 통해 지역적 능력을 끌어올린다는 점에서 배포성과 재현성 요구를 동시에 충족한다.
핵심 기여
하이브리드 Mamba–MoE 아키텍처로 긴 문맥 효율성 확보
Nemotron 3 Nano 레퍼런스 설계를 채택하여 Mamba-2 기반의 고정 크기 상태와 소수의 GQA 레이어만 KV 캐시를 유지하는 구조로 알맞게 조합했다. 이로 인해 토큰당 활성 파라미터는 약 3.2B로 유지되면서도 문맥이 늘어나도 추론용 KV 캐시 부담이 거의 일정하게 유지되어 긴 컨텍스트에서 높은 TPS를 실현했다.
독일어 비중을 의도적으로 높인 3단계 데이터 커리큘럼
약 27T 토큰의 사전학습을 세 단계(광범위 Phase1, 고품질 Annealing Phase2, 길이확장 Phase3)로 구성하고 Phase2에서 독일어 비중을 15.3%까지 올렸다. 각 소스별 토큰·에폭·효과적 기여를 공개하여 동일한 혼합을 재구성할 수 있도록 완전한 토큰 회계자료를 제공했다.
완전한 재현성 산출물 공개 약속
가중치, 선택된 중간 체크포인트, 소스별 토큰 회계, 학습 하이퍼파라미터와 학습 코드·평가 코드를 공개하겠다고 명시했다. 상업 라이선스가 허용하지 않는 경우에는 집계 통계와 정확한 혼합 기여도를 제공하여 감사 가능성을 확보했다.
대규모 인프라에서의 실무적 학습·서빙 파이프라인 운영
독일 국내의 Industrial AI Cloud 상에서 최대 512 B200 GPU를 사용해 학습을 수행했고 약 253,000 B200 GPU-시간을 소비했다. MoE 라우팅 특성에 맞춰 노드 내 NVLink 중심의 배치와 expert-parallel 설정을 유지하여 대규모 통신 병목을 줄였다.
핵심 아이디어 이해하기
대형 Transformer에서 긴 문맥을 처리할 때 병목은 모델 파라미터 수 자체가 아니라 각 시퀀스별로 유지되는 어텐션의 키·값(KV) 캐시와 그로 인한 메모리 대역폭 부담이다. 표준의 full-attention 구조는 시퀀스 길이에 따라 KV 캐시가 선형으로 증가하므로 긴 문맥과 다중 동시 요청이 동시에 발생하는 환경에서는 실효 처리량이 크게 떨어진다. Soofi S는 이 근본 비용을 낮추기 위해 시퀀스 혼합을 대부분 Mamba-2 유형의 고정 상태 갱신으로 처리하고 KV 캐시는 소수의 GQA 레이어에만 유지하여 토큰당 추가 상태 증가를 억제한다.
방법론
모델 설계는 Nemotron 3 Nano 참조구조를 그대로 사용하여 52개 레이어(23 Mamba-2, 23 MoE, 6 GQA)를 조합했다. MoE 레이어는 라우터 기반으로 토큰당 활성 전문가 수를 제한하여 전체 파라미터는 약 31.6B지만 순전파 시 활성 파라미터는 약 3.2B 수준을 유지했다. 학습은 Warmup–Stable–Decay(WSD) 스케줄을 적용하여 먼저 광범위 데이터로 안정적 표현을 학습한 뒤 고품질 데이터로 집중시키는 앤일링 단계로 전환했고 마지막으로 1M 토큰 길이의 long-context 확장을 별도 병렬설정으로 추가했다.
관련 Figure

학습률 패널은 Warmup–Stable–Decay 형태를 보이며 약 20T 토큰 지점에서 감쇠가 시작되는 것을 확인할 수 있다. 손실과 그래디언트 노름 패널은 안정적인 최적화 과정을 시사하고 처리량 패널은 체크포인트·재시작 구간을 제외하면 대체로 일정함을 보여 학습 안정성과 스케줄 설계의 정당성을 보완한다.
학습률 스케줄, 언어모델 손실, 그래디언트 노름, 훈련 처리량을 토큰 소비량 축에 따라 표시한 학습 역학 도표이다.

이 도표는 초기에는 영어 웹 비중이 크다가 Annealing 단계에서 독일어와 SFT·수학·코드의 비중이 늘어나는 커리큘럼 전략을 시각적으로 드러낸다. 각 단계별 토큰 예산(약 23T, 6T, 0.19T)과 도메인별 비중 변화가 병렬로 표현되어 데이터 설계가 모델 능력·지역화에 어떤 영향을 끼쳤는지 연결하는 증거 역할을 한다.
세 단계(Phase1~Phase3)에 걸친 효과적 토큰 혼합 비중을 도식화한 흐름도이며 독일어·수학·코드·SFT 등의 분포 변화를 보여준다.
주요 결과
Soofi S는 공개된 비교 대상들의 동일한 평가 파이프라인에서 영어·독일어 집계 성능과 코드·수학·추론 항목에서 상위권 결과를 기록했다. 오픈소스 모델군과의 비교에서는 영어 집계 70.1, 독일어 집계 79.1을 달성했고 코드와 수학 평가에서 다수의 벤치마크에서 최고점을 얻었다. 아키텍처 동일한 Nemotron 3 Nano와 비교하면 독일 특화 데이터 배분으로 GLP-DE에서 +15.1 포인트, 전체 독일 집계에서 +4.2 포인트의 개선이 관찰되었다.
관련 Figure

이 그림은 모델 능력(다섯 개 벤치마크 그룹 평균 정규화)과 실제 추론 처리량(TPS/GPU)을 동시에 보여주며 Soofi S가 높은 능력 점수와 함께 40K 컨텍스트에서 우수한 처리량을 유지함을 나타낸다. 점들이 모여 있는 위치와 다각형 영역은 유사한 설계군(오픈 유럽 모델, 국제 모델)을 구분하여 아키텍처·데이터 설계가 처리량과 능력의 트레이드오프에 미친 영향을 시각적으로 드러낸다.
Capability Index와 40K 컨텍스트에서의 GPU당 집계 디코드 TPS를 비교한 산점도로 Soofi S가 긴 컨텍스트 처리량과 능력 지표에서 상위에 위치한다.

그래프는 4K부터 256K까지 컨텍스트를 늘렸을 때 각 모델의 TPS 변화 곡선을 비교하며 Soofi S의 곡선이 거의 평탄한 반면 대부분의 밀집 모델은 급격히 하락함을 드러낸다. 이 시각적 근거는 KV 캐시 비용이 컨텍스트에 선형 종속임을 보여주고 Mamba–MoE 혼합 설계가 그 비용을 어떻게 완화하는지 실무적 수치로 뒷받침한다.
여러 모델의 컨텍스트 길이에 따른 GPU당 집계 디코드 TPS 변화를 로그 스케일로 플롯한 그래프로, Soofi S가 컨텍스트 증가에도 처리량을 잘 유지함을 보여준다.

바차트는 Soofi S가 여러 영역에서 최상위 또는 상위권에 위치함을 수치로 보여주며 특히 독일어 집계와 수학 관련 항목에서 큰 우위를 차지한 점이 눈에 띈다. 비교군의 색상과 순서는 동일한 평가 파이프라인 하에서의 직접 비교 가능성을 제공하여 데이터·아키텍처 선택이 성능 분포에 미친 효과를 정량적으로 뒷받침한다.
기초 모델 평가 개요 바차트로 영어·독일어 집계, 수학, MMLU 등 다양한 과제에서 Soofi S와 비교 대상 모델 점수를 나란히 표시한다.

그래프는 HumanEval, MBPP, LBPP 등에서 Soofi S가 특히 HumanEval과 MBPP에서 우수한 성과를 낸 반면 LBPP처럼 오염 민감 벤치마크에서는 일부 모델이 앞서는 사례도 있음을 보여준다. 이는 코드 데이터 구성과 사전학습 중의 SFT 포함이 실제 코드 생성 품질에 직접적 영향을 미쳤음을 시사한다.
코드 생성(pass@1) 평가 결과를 영어·독일어 데이터셋별로 비교한 막대그래프로 Soofi S가 여러 코드 벤치마크에서 선두권임을 보여준다.

GSM8K 및 GSM8K-Platinum-DE에서 Soofi S가 높은 점수를 기록했고 Minerva 계열의 경쟁형 수학에서는 대형 밀집 모델과 일부 근접한 성능을 보였다. 그림은 수학 데이터의 준비(LaTeX 보존, 수식 렌더링 파이프라인)가 성능에 미치는 영향을 간접적으로 확인시킨다.
수학 평가 결과를 GSM8K 및 경쟁형 수학 벤치마크로 나누어 비교한 막대그래프로 Soofi S의 수학 성능 우위를 보여준다.

두 패널은 MMLU, BBH, AGIEval, ARC 등에서의 점수를 보여주며 Soofi S가 특히 ARC-Challenge와 GPQA 계열에서 강한 성능을 보였음을 시사한다. 이 그림은 데이터 앤일링 단계에서의 SFT·리저닝 강화가 고난도 추론 과제의 성능 향상에 기여했음을 지지하는 시각적 근거를 제공한다.
지식 및 추론·과학 분야의 여러 벤치마크 점수를 비교한 쌍렬 막대그래프로 Soofi S가 광범위한 추론·지식 과제에서 경쟁력 있는 점수를 기록했다.
기술 상세
전체 구조는 52개 레이어로 구성되며 Mamba-2 레이어가 시퀀스 혼합을 담당하고 23개의 MoE 레이어는 전문가 라우팅으로 용량을 확장한다. 테이블화된 하이퍼파라미터로는 모델 차원 2688, 어텐션 쿼리 헤드 32, KV 헤드 2, 활성화 전문가 수 6, 전문가 차원 1856 등이 사용되었고 임베딩을 포함해 총 파라미터는 약 31.6B이다. 최적화는 AdamW를 사용했고 학습은 bf16 혼합정밀도로 수행되었으며 기본 WSD 스케줄에서 피크 lr=1e-3, decay 끝 최소 lr=1e-5로 설계되었다.
한계점
논문 저자들은 세 가지 한계를 명확히 보고했다. 첫째, Minerva 평가에서 초기 평가 설정이 생성 중단 규칙으로 인해 점수가 왜곡되어 평가 프로토콜을 수정한 후 최종 점수를 보고했다. 둘째, 경쟁형 수학(특히 독일어 Minerva MATH-DE)에서는 아직 대형 밀집 모델 대비 격차가 존재했다. 셋째, 공개 데이터와 활성 파라미터 제한으로 인해 오픈도메인 사실회수(NaturalQuestions)에서는 가장 큰 밀집 모델들에 비해 소폭 뒤처지는 경향이 관찰되었다.
실무 활용
Soofi S는 긴 문맥과 고동시성 배포 환경에서 추론 처리량을 우선하는 응용에 적합하며, 독일어 중심 서비스나 바이링궐 애플리케이션에 유리한 성능·데이터 균형을 가진다. 공개된 가중치와 학습 산출물을 통해 연구 검증, 지역화된 서비스 실험, 기업 내부 재학습 등에서 활용할 수 있다.
- 대규모 동시 접속을 요구하는 장기 대화형 챗봇의 백엔드로 사용하여 문맥 길이에 따른 처리량 저하를 줄이는 배포
- 독일어 기술 문서 자동화와 코드 생성 파이프라인에서 별도 지역화된 SFT 없이도 상위 성능 확보
- 연구 목적으로 데이터 혼합·에폭·토큰 회계가 공개된 상태에서 재현 가능한 실험 진행
- 1M 토큰 단위의 긴 문서 요약·분석 파이프라인에서 전처리·토큰화 전략 검증
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Mamba-2
- — Mamba-2는 순환 상태를 이용해 시퀀스 혼합을 수행하는 레이어 설계로, 전체 어텐션의 N² 연산을 피하고 상태 크기를 고정시켜 긴 문맥에서의 메모리·추론 비용을 낮춘다. 이 논문에서는 주로 시퀀스 혼합을 Mamba-2가 담당하여 KV 캐시 증가를 억제하는 역할을 했다.
- Grouped-Query Attention
- — Grouped-Query Attention은 키·값 헤드를 소수로 제한하고 쿼리 헤드를 그룹화해 어텐션 상태의 메모리 증가를 줄이는 방법으로, KV 캐시의 토큰당 크기를 축소하여 긴 컨텍스트 추론에서 메모리 대역폭 부담을 줄인다.
- Mixture-of-Experts (MoE)
- — Mixture-of-Experts는 전체 파라미터 중 일부 전문가만 토큰 단위로 활성화하는 라우팅 기법으로, 총 용량을 키우면서 토큰당 활성 파라미터를 작게 유지해 추론 비용 대비 표현력을 개선한다. Soofi S는 MoE 레이어로 활성 파라미터를 3B 수준으로 유지했다.
- KV cache
- — KV 캐시는 디코딩 중 어텐션을 위해 과거 토큰의 키·값을 저장하는 구조로, 문맥 길이가 늘어나면 토큰당 저장 공간과 읽기 비용이 선형으로 증가하여 긴 컨텍스트에서 처리량 저하를 유발한다. Soofi S는 KV 캐시를 소수 레이어에만 유지해 이 비용을 최소화했다.
- Warmup–Stable–Decay (WSD)
- — WSD는 초기 선형 워밍업, 장기간의 안정 구간, 이후 감쇠(decay)를 순차 적용하는 학습률 스케줄로, 초반에는 폭넓은 데이터에 노출하고 감쇠 구간에서 고품질 데이터에 집중시키는 커리큘럼 설계에 유리하다. 논문에서는 20T 토큰 지점에서 decay를 시작했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.