Motif-Technologies/Motif-3
256K 문맥과 희소 Expert 라우팅으로 장기 에이전트 작업을 겨냥한 314B MoE
학습 방식 · Motif-Technologies/Motif-3-Base를 기반으로 한 대규모 post-training 모델입니다. 약 12.5T 토큰으로 웹·STEM·코드·수학·다국어 및 법률·금융 데이터를 사전학습한 뒤, 일반 SFT와 6개의 RL specialist teacher, software-engineering teacher를 결합했습니다. Multi-teacher On-Policy Distillation(MOPD)으로 여러 교사의 지식을 하나의 모델에 통합했습니다.
TL;DR
Motif 3는 Motif-Technologies/Motif-3-Base를 기반으로 추가 학습한 314B decoder-only MoE 모델이며, 토큰마다 13.2B 파라미터만 활성화합니다. 384개 Routed Expert에서 top-8과 Shared Expert 1개를 선택하고, GDLA의 압축 KV 표현과 256K Native Context로 장문 처리 비용을 낮추는 구조입니다. 약 12.5T 토큰과 한국어·코드·수학·법률·금융 데이터를 사용했으며, SFT·RL specialist teacher·MOPD를 거쳐 장기 에이전트 작업에 맞췄습니다. τ²-Bench Telecom 94.7, ITBench 51.5, Terminal-Bench 2.1 74.9를 기록했지만 배포 예시는 H200 또는 B200 8-way 환경을 전제로 합니다.
핵심 포인트
- 384개 Routed Expert 중 토큰마다 8개와 Shared Expert 1개만 활성화해 314B 전체 규모를 13.2B 활성 파라미터로 처리합니다. 이 구조는 전문화된 Expert 풀을 유지하면서 토큰당 연산량을 제한합니다. 대규모 모델 용량과 희소 추론을 함께 노린 설계입니다.
- GDLA는 Differential Attention과 압축된 KV 표현을 결합해 Attention 표현력을 유지하면서 KV-cache 요구량을 줄입니다. Expert-Specific PolyNorm은 Expert별 학습 계수로 activation outlier를 낮추고 전문화를 돕습니다. mHC는 4개 Residual Stream을 Birkhoff-polytope 기반으로 섞어 학습 안정성을 보강합니다.
- 256K Native Context와 12.5T 토큰 사전학습으로 긴 문서와 장기 실행 작업을 겨냥합니다. 데이터에는 웹·STEM·코드·수학·다국어·법률·금융 및 한국어 자료가 포함됩니다. MTP Head는 Self-Speculative Decoding에 사용되어 추론 효율을 높입니다.
- Agentic 작업과 Terminal 기반 문제 해결에서 강점을 내세우며, SWE-Bench Verified 76.2와 Terminal-Bench 2.1 74.9를 기록했습니다. τ²-Bench Telecom은 94.7, τ³-Banking은 35.3입니다. 답변 근거가 부족한 상황에서 보류하는 동작까지 평가 대상에 포함합니다.
제한사항
- 314B 전체 파라미터와 256K context를 사용하는 대형 MoE라서 일반적인 단일 GPU 환경보다 큰 배포 자원이 필요합니다. README의 vLLM 배포 예시는 H200 또는 B200에서 data parallel 8과 Expert Parallel을 사용합니다. 실제 운영에는 제공된 vLLM 이미지와 맞춤형 설정을 함께 적용해야 합니다.
- 배포 예시는 vLLM의 trust-remote-code와 Motif 전용 tool-call parser 및 reasoning parser를 요구합니다. MTP 기반 Self-Speculative Decoding도 num_speculative_tokens 1과 별도 speculative 설정이 필요합니다. 기본 Transformers 실행만으로 README의 최적화된 추론 경로가 재현된다고 보기는 어렵습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| τ²-Bench Telecom | score | 94.7 | README가 해당 benchmark leaderboard에서 인용한 비교 수치이며, MiniMax-3 88.9 및 GLM-5.1 97.7과 비교됨 |
| τ³-Banking | score | 35.3 | README가 해당 benchmark leaderboard에서 인용한 비교 수치이며, MiniMax-3 15.3 및 DS-v4-Pro 30.1보다 높음 |
| ITBench | score | 51.5 | README가 공개 데이터셋 기준으로 제시한 수치이며, GLM-5.1 40.3 및 DS-v4-Pro 38.3보다 높음 |
| SWE-Bench Verified | score | 76.2 | README가 해당 benchmark leaderboard에서 인용한 비교 수치이며, MiniMax-3 75.0 및 Kimi-K2.6 76.2와 같고 Qwen-3.7 80.4보다 낮음 |
| Terminal-Bench 2.1 | score | 74.9 | README가 해당 benchmark leaderboard에서 인용한 비교 수치이며, MiniMax-3 65.2 및 GLM-5.1 61.8보다 높고 Qwen-3.7 75.0에 근접함 |
| GPQA Diamond | score | 83.4 | README가 해당 benchmark leaderboard에서 인용한 비교 수치이며, GLM-5.1 86.8 및 Qwen-3.7 92.4보다 낮음 |
| AA-LCR | score | 72.3 | README가 해당 benchmark leaderboard에서 인용한 비교 수치이며, MiniMax-3 80.3 및 Kimi-K2.6 76.7보다 낮음 |
| IFBench | score | 78.2 | README가 해당 benchmark leaderboard에서 인용한 비교 수치이며, MiniMax-3 82.9 및 Qwen-3.7 79.1보다 낮고 GLM-5.1 76.3보다 높음 |
68
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.