Mamba-2·MoE 하이브리드 기반 1M 토큰 장기문맥 베이스 모델 프리뷰
Soofi-S-30B-A3B는 Mamba-2/MoE 하이브리드로 1M 토큰 장기문맥을 지원하는 영어·독일어 중심의 베이스 텍스트 생성 모델이다.
TL;DR
Soofi-S-30B-A3B는 SOOFI 컨소시엄이 개발한 영어·독일어 중심의 베이스 텍스트 생성 모델로서 Nemotron 3 Nano 참조 설계를 따르는 Mamba-2/MoE 하이브리드 아키텍처를 채택하였다. 모델은 scratch로 학습되었고 3단계 커리큘럼과 장기문맥 확장 훈련을 통해 최대 1,048,576 토큰까지 처리하도록 설계되었으며 단일 B200 환경에서 컨텍스트 40K, 배치 32 조건에서 약 4.8k TPS의 디코드 처리량을 보고하였다. 128개 전문가 중 토큰당 6개를 활성화하는 라우팅과 GQA 계층의 제한적 KV 캐시 적용으로 컨텍스트 확장 시에도 처리량 저하를 억제하는 구조적 이점을 확보했으며 공개 베이스 모델 비교에서 영어·독일어 코드 집계 최상위를 기록했다. 다만 이 체크포인트는 unaligned 베이스 모델로서 인스트럭션 튜닝이나 안전성 정렬을 거치지 않았고 실제 배포 전에는 SFT/RLHF 등 후속 정렬과 케이스별 검증이 필요하다.
핵심 역량
- 자연어 텍스트 완전화를 연속적 토큰 예측으로 수행하며 긴 컨텍스트에서 문맥 유지를 통해 일관된 장문 출력을 생성할 수 있다. 영어와 독일어를 주 대상으로 학습되어 해당 언어들에서 더 균일한 품질을 보이며 코드 관련 집계에서도 상위 성능을 기록한 점이 보고되었다. 베이스 모델 특성상 파인튜닝을 통해 대화용 인스트럭션 모델이나 도메인 특화 모델로 확장하는 것이 의도된 사용 방식이다.
- 긴 문맥 처리 능력을 바탕으로 수십만 토큰 길이의 입력에서 디코드 처리량 저하를 억제하며 대규모 문서 완성이나 장기 대화 상태를 유지하는 작업에서 이점을 제공한다. GQA 계층의 제한적 KV 캐시와 Mamba-2 시퀀스 믹싱 설계가 결합되어 컨텍스트 확장 시 메모리 성장률을 낮추는 구조적 이점을 확보했다. 이러한 능력은 긴 대화 히스토리를 유지해야 하는 에이전트나 문서 요약, 장문 생성 워크플로우에 적용될 수 있다.
- 파라미터 수 대비 희소 연산을 적용하는 MoE 구성으로 토큰당 활성 파라미터를 제한해 연산 효율을 개선하는 동시에 모델 규모의 표현력을 유지한다. 라우터가 토큰별로 소수의 전문가를 선택하여 연산을 집중시키므로 동일 파라미터 예산 내에서 다양한 기능을 학습할 수 있다. 이 구조는 파인튜닝 이전의 베이스 모델로서 폭넓은 적응 가능성을 보장한다.
강점
- 공개 베이스 모델 16종 비교에서 영어와 독일어 코드 관련 집계에서 최상위를 기록한 점이 보고되어 있어 코드·언어 능력의 경쟁적 지위를 확보했다. 비교 대상에는 Olmo 3 32B 및 Apertus 70B 등이 포함되어 있으며 해당 비교에서 우위를 보인 점이 기술 보고서에 근거로 제시되었다. 이러한 집계 우위는 베이스 모델로서 후속 파인튜닝 시 강력한 출발점을 제공한다.
- 긴 문맥에서 디코드 처리량이 4K에서 256K 구간에서 거의 일정하게 유지된다고 보고되어 장문 생성 시 처리율 저하가 적은 구조적 이점을 보였다. 구체적으로 단일 B200 GPU, 40K 컨텍스트, 배치 32 환경에서 약 4.8k TPS의 디코드 처리량을 기록한 점이 공개되어 있다. 이 특성은 긴 대화 유지나 대형 문서 처리 파이프라인에서 처리량과 레이턴시 트레이드오프를 개선하는 실용적 장점으로 연결된다.
훈련 방식
모델은 Nemotron 3 Nano 참조 설계를 기반으로 처음부터(scratch) 학습되었고 WSD(Warmup–Stable–Decay) 학습률 스케줄에 따라 세 단계로 커리큘럼화되어 학습이 진행되었다. 최종 장기문맥 단계에서 1M 토큰까지 확장하는 전용 학습을 수행하여 긴 시퀀스 처리 능력을 확보했고 학습은 bf16 정밀도와 AdamW 옵티마이저를 사용해 대규모 B200 클러스터에서 수행되었다. 데이터 혼합은 고품질 코퍼스와 합성 및 기계번역 자료를 포함하며 독일어 데이터 비중을 의도적으로 높여 영어·독일어 성능 균형을 맞추었다.
알아두면 좋은 것
- 이 체크포인트는 closed beta 프리뷰 상태로 선택된 파트너와 협업 중인 연구 산물이며 가중치와 행동이 점진적으로 변할 수 있다. 최종 버전은 관대한 라이선스로 공개될 예정이라고 명시되어 있어 향후 접근성과 사용 조건이 변경될 가능성이 있다. 현재 리포지토리의 사용은 연구와 개발 목적으로 제한되며 실제 배포 전 추가적인 검증이 필요하다.
- 사전학습은 스태블, 어닐링, 장기문맥 단계를 포함한 3단계 커리큘럼으로 진행되었고 총 소비 토큰은 약 26.68T에 이른다. 독일어는 학습 혼합에서 의도적으로 업웨이트되어 Phase 2에서는 15.3% 비중을 차지하는 등 언어 혼합 비율에 설계적 편향이 존재한다. 데이터 소스는 공개 코퍼스와 합성·기계번역 자료, 소수의 상업적 라이선스 데이터가 혼합되어 있으며 소스별 혼합 표는 기술 보고서에 공개되어 있다.
- 컴퓨팅 리소스는 누적 약 253,000 B200 GPU-시간을 사용하였고 훈련 인프라는 유럽의 재생 에너지 기반 시설에서 운영되었다고 명시되어 있다. 학습은 전량 scratch로 이루어졌으며 Nemotron 3 Nano 참조 설계를 수정 없이 따랐다. 이러한 대규모 리소스와 지역적 인프라 선택은 주권적 모델 개발과 에너지·데이터 거버넌스 관점에서 설계 근거를 제공한다.
- 이 모델은 베이스 체크포인트로서 어떠한 안전성 튜닝이나 인스트럭션 튜닝을 거치지 않았으므로 원시 출력은 반복적이거나 부적절할 수 있고 실제 적용 전 SFT 또는 RLHF 등 후속 정렬 단계가 요구된다. 모델 카드의 윤리 섹션은 사용자가 내부 검증 절차와 가드레일을 마련해야 함을 명시하고 있다. 미정렬 상태임을 명확히 밝히기 때문에 배포 전 위험 분석과 사용자 지정 정렬이 필수적이다.
기술적 특징
- 아키텍처는 Mamba-2 시퀀스 믹싱, granular MoE, 그리고 GQA 계층을 혼합한 Nemotron 3 Nano 설계를 그대로 채택하였다. 구체적으로 총 52개 레이어 중 23개가 Mamba-2, 23개가 MoE, 6개가 GQA로 구성되어 있으며 각 MoE 레이어는 128개 전문가와 2개의 공유 전문가를 포함한다. 이 구성은 긴 컨텍스트에서 메모리 오버헤드를 관리하면서 전문가 기반 희소성을 통해 표현력을 유지하도록 설계되었다.
- 라우터 설계는 토큰당 6개 전문가를 활성화하도록 학습된 MLP 기반 라우터와 시그모이드 게이팅을 사용하여 희소 활성화를 구현한다. 이 방식은 각 토큰에 대해 전체 전문가 풀을 평가하지 않고도 다양한 기능을 전문가군에 분배할 수 있게 하며 파라미터 활용 효율을 높인다. 활성화되는 전문가 수와 라우팅 메커니즘은 모델의 계산 비용과 토큰별 표현 다양성 사이의 균형을 제어하는 핵심 요소이다.
- GQA 계층은 오직 6개 레이어만 KV 캐시를 유지하도록 설계되어 전체 시퀀스 캐시 성장을 억제한다. 각 GQA 레이어는 2개의 KV 헤드를 유지하며 토큰당 약 6KB 수준의 추가 캐시 오버헤드를 산출한다고 명시되어 있다. 이 제한적 KV 캐시 적용은 전체 컨텍스트 길이가 커질 때도 디코드 처리량이 유지되도록 하는 실무적 설계 선택이다.
- 모델은 positional embeddings를 사용하지 않고 RMSNorm 및 untied embeddings를 채택하였으며 모델 차원은 2688로 설정되어 있다. 이러한 설계는 Nemotron 3 Nano 참조 설계의 특성을 따르며, 포지셔널 임베딩 없이도 시퀀스 혼합과 SSM 요소로 장거리 의존성을 처리하도록 구성되었다. 따라서 구현과정에서는 참조 설계와 호환되는 런타임과 최적화가 필요하다.
차별점
- Mamba-2와 MoE를 혼합한 하이브리드 설계로서 긴 컨텍스트에서 캐시 오버헤드를 낮추는 구조적 이점을 확보했다. 이 점은 GQA 기반 제한적 KV 캐시와 결합되어 컨텍스트 확장 시 디코드 처리량이 크게 저하되지 않는 실무적 이득을 제공한다. 동일 용도의 풀 어텐션 모델 대비 긴 문맥 처리 시 성능 저하를 덜 경험할 가능성이 높다.
- 전문가 수와 활성화 전략으로 128개 전문가 중 6개 활성화라는 비교적 밀집된 희소화 설정을 사용하여 토큰당 활성 파라미터를 통제했다. 이 설정은 대규모 파라미터를 유지하면서도 토큰별 계산량을 절감하는 방향으로 설계되어 파인튜닝 전 베이스 모델의 연산 효율을 높인다. 라우터의 MLP 시그모이드 게이팅은 토큰별 전문가 선택의 안정성과 다양성을 동시에 지원한다.
- 1M 토큰까지 확장한 장기문맥 전용 학습 단계를 포함한 커리큘럼을 적용하여 매우 긴 입력 시퀀스에서의 동작을 목표로 했다. 이 커리큘럼은 초기의 넓은 토큰 풀에서 고품질 데이터 업샘플링을 거쳐 장기문맥에 맞춘 미세 조정을 포함한다. 결과적으로 긴 문맥 기반 태스크에서 일관된 출력을 유지하는 능력이 차별화 포인트로 작동한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| decode throughput | throughput (TPS) | ~4.8k TPS on a single B200 GPU at 40K context, batch 32 | aggregate decode throughput remains essentially flat from 4K to 256K context |
| English and German code aggregate rank | rank among open base models | 1st among 16 open base models on English and German code aggregates | ahead of Olmo 3 32B and Apertus 70B in the reported comparison |
71
Likes
95
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.