본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Soofi-Project/Soofi-S-Base

순수한 텍스트 완성(next-token prediction) 태스크에 최적화된 베이스 모델로서 프롬프트 기반 완전한 문장 확장을 수행한다. 이 모델은 별도의 채팅 템플릿이나 시스템 프롬프트를 기대하지 않으며 단일 문자열 입력을 받아 다음 토큰을 연속적으로 생성하는 구조를 따른다. 베이스 체크포인트이므로 Instruction Tuning이나 안전성 정렬을 거치지 않은 상태에서 후처리와 미세조정으로 다양한 다운스트림 태스크에 적응시킬 수 있다.31.6B1K 컨텍스트closed-beta

Soofi-S-30B-A3B는 Mamba-2/MoE 하이브리드로 1M 토큰 장기문맥을 지원하는 영어·독일어 중심의 베이스 텍스트 생성 모델이다.

학습 방식 · 모델은 Nemotron 3 Nano 참조 설계를 기반으로 처음부터(scratch) 학습되었고 WSD(Warmup–Stable–Decay) 학습률 스케줄에 따라 세 단계로 커리큘럼화되어 학습이 진행되었다. 최종 장기문맥 단계에서 1M 토큰까지 확장하는 전용 학습을 수행하여 긴 시퀀스 처리 능력을 확보했고 학습은 bf16 정밀도와 AdamW 옵티마이저를 사용해 대규모 B200 클러스터에서 수행되었다. 데이터 혼합은 고품질 코퍼스와 합성 및 기계번역 자료를 포함하며 독일어 데이터 비중을 의도적으로 높여 영어·독일어 성능 균형을 맞추었다.

TL;DR

Soofi-S-30B-A3B는 SOOFI 컨소시엄이 개발한 영어·독일어 중심의 베이스 텍스트 생성 모델로서 Nemotron 3 Nano 참조 설계를 따르는 Mamba-2/MoE 하이브리드 아키텍처를 채택하였다. 모델은 scratch로 학습되었고 3단계 커리큘럼과 장기문맥 확장 훈련을 통해 최대 1,048,576 토큰까지 처리하도록 설계되었으며 단일 B200 환경에서 컨텍스트 40K, 배치 32 조건에서 약 4.8k TPS의 디코드 처리량을 보고하였다. 128개 전문가 중 토큰당 6개를 활성화하는 라우팅과 GQA 계층의 제한적 KV 캐시 적용으로 컨텍스트 확장 시에도 처리량 저하를 억제하는 구조적 이점을 확보했으며 공개 베이스 모델 비교에서 영어·독일어 코드 집계 최상위를 기록했다. 다만 이 체크포인트는 unaligned 베이스 모델로서 인스트럭션 튜닝이나 안전성 정렬을 거치지 않았고 실제 배포 전에는 SFT/RLHF 등 후속 정렬과 케이스별 검증이 필요하다.

핵심 포인트

  • Mamba-2와 MoE를 혼합한 하이브리드 설계로서 긴 컨텍스트에서 캐시 오버헤드를 낮추는 구조적 이점을 확보했다. 이 점은 GQA 기반 제한적 KV 캐시와 결합되어 컨텍스트 확장 시 디코드 처리량이 크게 저하되지 않는 실무적 이득을 제공한다. 동일 용도의 풀 어텐션 모델 대비 긴 문맥 처리 시 성능 저하를 덜 경험할 가능성이 높다.
  • 전문가 수와 활성화 전략으로 128개 전문가 중 6개 활성화라는 비교적 밀집된 희소화 설정을 사용하여 토큰당 활성 파라미터를 통제했다. 이 설정은 대규모 파라미터를 유지하면서도 토큰별 계산량을 절감하는 방향으로 설계되어 파인튜닝 전 베이스 모델의 연산 효율을 높인다. 라우터의 MLP 시그모이드 게이팅은 토큰별 전문가 선택의 안정성과 다양성을 동시에 지원한다.
  • 1M 토큰까지 확장한 장기문맥 전용 학습 단계를 포함한 커리큘럼을 적용하여 매우 긴 입력 시퀀스에서의 동작을 목표로 했다. 이 커리큘럼은 초기의 넓은 토큰 풀에서 고품질 데이터 업샘플링을 거쳐 장기문맥에 맞춘 미세 조정을 포함한다. 결과적으로 긴 문맥 기반 태스크에서 일관된 출력을 유지하는 능력이 차별화 포인트로 작동한다.
  • 공개 베이스 모델 16종 비교에서 영어와 독일어 코드 관련 집계에서 최상위를 기록한 점이 보고되어 있어 코드·언어 능력의 경쟁적 지위를 확보했다. 비교 대상에는 Olmo 3 32B 및 Apertus 70B 등이 포함되어 있으며 해당 비교에서 우위를 보인 점이 기술 보고서에 근거로 제시되었다. 이러한 집계 우위는 베이스 모델로서 후속 파인튜닝 시 강력한 출발점을 제공한다.

벤치마크

벤치마크지표비교
decode throughputthroughput (TPS)~4.8k TPS on a single B200 GPU at 40K context, batch 32aggregate decode throughput remains essentially flat from 4K to 256K context
English and German code aggregate rankrank among open base models1st among 16 open base models on English and German code aggregatesahead of Olmo 3 32B and Apertus 70B in the reported comparison

71

LIKES

95

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.