3B 활성 파라미터로 30B급 성능을 압도하는 초고효율 MoE 모델
텍스트 생성, 추론, 코딩, 도구 사용(Agentic tasks)48B (3B Activated)128K 컨텍스트Modified MIT
3B 활성 파라미터만으로 MMLU 89.5점과 뛰어난 에이전트 성능을 제공하는 고효율 MoE 모델입니다.
핵심 역량
- 3B 활성 파라미터 (총 48B MoE)
- 128K 토큰 컨텍스트 지원
- HumanEval 96.34점의 강력한 코딩 능력
- FiberPO 기반의 안정적인 강화학습 최적화
- OpenAI 호환 API 및 vLLM/SGLang 지원
- 도구 호출(Tool Call) 및 에이전트 기능 특화
알아두면 좋은 것
- MMLU 89.50점, GSM8K 95.83점으로 동급 최강의 벤치마크 성능 기록
- SWE-bench Verified 60.60점으로 뛰어난 실전 소프트웨어 엔지니어링 능력 입증
- 중국어(zh) 및 영어(en) 지원 (한국어 공식 언급 없음)
- Muon 최적화와 Dense MTP 적용으로 기존 대비 1.3~1.7배 처리량 향상
154
Likes
1.3k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.