본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Motif-Technologies/Motif-3-Beta

멀티링구얼 범용 텍스트 생성(대형 MoE, 프리뷰 체크포인트)약 314B (전체), 활성 파라미터 약 13B256K 컨텍스트비상업적 연구·교육용 (상업적 이용 시 Motif Technologies 서면 허가 필요)

Motif Technologies가 처음부터 자체 설계한 314B 규모 MoE 프리뷰 모델로, GDLA 어텐션과 256K 네이티브 장문맥, 자기추정 디코딩을 갖췄다.

학습 방식 · 기존 오픈소스 아키텍처를 차용하지 않고 GDLA·Grouped PolyNorm·수정 mHC 등을 포함한 완전 자체 설계 아키텍처로 384개 전문가 MoE를 처음부터 학습했다.

TL;DR

Motif-3-Beta는 Motif Technologies가 기존 오픈소스 아키텍처를 재구성하지 않고 처음부터 설계한 약 314B 총 파라미터·13B 활성 파라미터의 MoE 언어모델 프리뷰 체크포인트다. Grouped Differential Latent Attention(GDLA), 전문가별 Grouped PolyNorm 활성화, 수정된 mHC, 자기추정 디코딩을 위한 1개 층의 Multi-Token Prediction 헤드 같은 커스텀 컴포넌트를 도입했고, 384개 전문가 중 8개와 공유 전문가 1개를 활성화하는 라우팅으로 256K(262,144) 토큰 네이티브 장문맥을 지원한다. Artificial Analysis Intelligence Index(AAII) 44점을 기록했으며, vLLM 기반 Docker 이미지로 B200·H200 GPU에서 서빙할 수 있고 자기추정 디코딩(num_speculative_tokens=1)이 최적으로 동작한다고 안내한다. 최종 체크포인트는 별도로 공개될 예정이라 이 리포는 중간 프리뷰 성격의 결과물이다.

핵심 포인트

  • 기존 오픈소스 아키텍처를 재구성하지 않고 GDLA·Grouped PolyNorm·수정 mHC 등을 자체 설계해 처음부터 학습한 모델이다.
  • 384개 전문가 중 8개+공유 전문가 1개만 활성화(총 314B/활성 13B)해 256K 네이티브 장문맥을 지원한다.
  • 1층 MTP 헤드로 자기추정 디코딩을 지원해 num_speculative_tokens=1 설정이 최적이라고 안내한다.
  • 누구나 접근 요청 없이 가중치를 내려받을 수 있게 공개됐지만 상업적 이용은 별도 서면 허가가 필요하다.

제한사항

  • 최종 릴리스가 아닌 프리뷰/베타 체크포인트로, 최종 버전은 추후 별도로 공개될 예정이다.
  • vLLM 서빙은 B200·H200 GPU에서만 테스트됐다.

벤치마크

벤치마크지표비교
Artificial Analysis Intelligence Index (AAII)score44

205

LIKES

2.7k

DOWNLOADS

5 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.