Motif-Technologies/Motif-3-Beta
Motif Technologies가 처음부터 자체 설계한 314B 규모 MoE 프리뷰 모델로, GDLA 어텐션과 256K 네이티브 장문맥, 자기추정 디코딩을 갖췄다.
학습 방식 · 기존 오픈소스 아키텍처를 차용하지 않고 GDLA·Grouped PolyNorm·수정 mHC 등을 포함한 완전 자체 설계 아키텍처로 384개 전문가 MoE를 처음부터 학습했다.
TL;DR
Motif-3-Beta는 Motif Technologies가 기존 오픈소스 아키텍처를 재구성하지 않고 처음부터 설계한 약 314B 총 파라미터·13B 활성 파라미터의 MoE 언어모델 프리뷰 체크포인트다. Grouped Differential Latent Attention(GDLA), 전문가별 Grouped PolyNorm 활성화, 수정된 mHC, 자기추정 디코딩을 위한 1개 층의 Multi-Token Prediction 헤드 같은 커스텀 컴포넌트를 도입했고, 384개 전문가 중 8개와 공유 전문가 1개를 활성화하는 라우팅으로 256K(262,144) 토큰 네이티브 장문맥을 지원한다. Artificial Analysis Intelligence Index(AAII) 44점을 기록했으며, vLLM 기반 Docker 이미지로 B200·H200 GPU에서 서빙할 수 있고 자기추정 디코딩(num_speculative_tokens=1)이 최적으로 동작한다고 안내한다. 최종 체크포인트는 별도로 공개될 예정이라 이 리포는 중간 프리뷰 성격의 결과물이다.
핵심 포인트
- 기존 오픈소스 아키텍처를 재구성하지 않고 GDLA·Grouped PolyNorm·수정 mHC 등을 자체 설계해 처음부터 학습한 모델이다.
- 384개 전문가 중 8개+공유 전문가 1개만 활성화(총 314B/활성 13B)해 256K 네이티브 장문맥을 지원한다.
- 1층 MTP 헤드로 자기추정 디코딩을 지원해 num_speculative_tokens=1 설정이 최적이라고 안내한다.
- 누구나 접근 요청 없이 가중치를 내려받을 수 있게 공개됐지만 상업적 이용은 별도 서면 허가가 필요하다.
제한사항
- 최종 릴리스가 아닌 프리뷰/베타 체크포인트로, 최종 버전은 추후 별도로 공개될 예정이다.
- vLLM 서빙은 B200·H200 GPU에서만 테스트됐다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Artificial Analysis Intelligence Index (AAII) | score | 44 | — |
205
LIKES
2.7k
DOWNLOADS
5 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.