deepgrove/maple-preview
활성 파라미터를 1.49B로 줄여 200+ tokens/s 고속 추론과 IMO 수준 추론을 목표로 한 20B 추론 모델
학습 방식 · Maple-Preview는 처음부터 on-device 추론 효율을 목표로 아키텍처와 가중치 표현을 설계한 모델이며, ternary-weight와 Mixture-of-Experts 구성으로 학습된 점이 핵심입니다. README에는 에이전트형 과업에 대해서는 최소한의 사후 훈련과 소규모 RL만 적용되었다고 명시되어 있어 폭넓은 SFT나 RLHF 기반 튜닝으로 일반성 향상을 목표로 하는 후속 작업이 예정되어 있습니다. 구현 측면에서는 Transformers 런타임이 Triton·FlashAttention에 의존하고, Apple Silicon에서는 별도 온디바이스 런타임을 사용해 서로 다른 실행 경로를 통해 성능을 확보하는 방식입니다.
TL;DR
Maple-Preview는 24-layer 256-expert(8 active) 구조와 ternary-weight 표현을 결합한 20B-A1B Mixture-of-Experts 추론 모델로, 활성 파라미터를 약 1.49B 수준으로 억제해 체크포인트를 5.31GB로 줄이고 Mac mini M4에서 약 218 tokens/s의 높은 처리량을 달성합니다. SWA-512:GA 3:1 attention과 MoE 활성화 설계가 긴 컨텍스트(131,072 tokens)를 유지하면서도 처리 효율을 확보하는 핵심 메커니즘입니다. 벤치마크에서는 평균 78.7점을 기록해 동급 모델 대비 강한 추론 성능을 보이지만, 프리뷰라는 이유로 에이전트형 작업에 대한 후처리가 제한되어 있어 범용성 향상을 위한 추가 훈련이 필요합니다.
핵심 포인트
- Maple-Preview는 20B-A1B 규격의 ternary-weight Mixture-of-Experts 모델로서 핵심 설계는 메모리 절감과 활성 파라미터 최소화를 통한 고속 추론입니다. 내부 구조는 24개 레이어와 256개의 전문가(expert)를 갖추고 있으며 각 토큰마다 8개의 전문가만 활성화되도록 설계되어 처리 비용을 줄입니다. 가중치를 ternary(삼진값)로 표현해 체크포인트 크기를 5.31GB로 낮추었고, 이로 인해 로컬 장치에서 200+ tokens/s 수준의 추론이 가능해졌습니다.
- 추론 효율을 끌어올리기 위해 주목(attention) 설계에서 3:1 SWA-512:GA 비율을 적용했고, 출력은 dense head를 사용해 벤치마크 점수를 산출합니다. 이 조합이 긴 컨텍스트(131,072 tokens)를 유지하면서도 처리량을 확보하는 동작 메커니즘을 제공합니다. 결과적으로 Mac mini M4에서 218 tokens/s를 기록해 같은 계열의 효율 모델들보다 5~16배 빠른 처리율을 보였습니다.
- 성능 측면에서는 수치화된 논리·수학적 추론 능력이 강조되어 있으며, README와 표에 따르면 LCBv6·AIME26·HMMT26·GPQA-D 등에서 평균 78.7점을 기록했습니다. 특히 AIME26과 같은 고난도 수학 문제에서 높은 점수를 받는 것이 눈에 띄며, 개발자는 이 모델을 'reasoning'에 초점을 맞춘 프리뷰로 위치시켰습니다. dense 출력 헤드를 사용한 비교 결과를 바탕으로 동급 무게(class)에서 경쟁력 있는 추론 성능을 확보했다는 근거가 제시되어 있습니다.
- 배포·실행 환경에서는 Transformers 구현이 Triton과 FlashAttention에 의존하며, GPU 환경에서는 해당 스택이 필요합니다. Apple Silicon 결과는 별도 온디바이스 런타임을 통해 보고되었고, README는 CUDA 환경과 Apple 환경의 실행 경로가 분리되어 있음을 명확히 제시합니다. 이 때문에 로컬 Mac에서의 빠른 속도와 CUDA 기반 서버 실행 방식이 서로 다른 실행체계를 따른다는 점을 고려해야 합니다.
제한사항
- 이 프리뷰 버전은 주로 순수 추론 능력에 초점을 맞추어 학습 경로가 편향되어 있어 에이전트형(agentic) 벤치마크에서는 성능 저하가 발생할 가능성이 있습니다. README에서 개발자는 에이전트 작업에 대한 후처리 훈련이 최소화되었다고 명시했고, 따라서 멀티턴 대화 기반의 행동·계획 수행 능력은 완전한 제품 수준과 차이를 보일 수 있습니다. 확장된 일반성이나 안전성 개선을 위해 추가적인 파인튜닝과 대규모 RL 과정이 필요하다는 점을 고려해야 합니다.
- 실행 환경 제약이 존재하며, Transformers 구현은 Triton과 FlashAttention에 의존하므로 CUDA 호환 GPU 환경에서만 동일한 성능을 재현할 수 있습니다. Apple Silicon에서는 별도 런타임을 사용해 보고된 수치(218 tok/s)를 달성했지만, 이 경로는 README가 별도로 제공하는 온디바이스 런타임에 의존합니다. 따라서 배포 대상 하드웨어와 런타임 스택에 따라 실제 처리량과 호환성이 크게 달라질 수 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| LCBV6 | score | 75.1 | — |
| AIME 2026 | score | 87.5 | — |
| HMMT 2026 | score | 78.8 | — |
| GPQA-D | score | 73.5 | — |
| Average (dense head) | average score | 78.7 | 동표에서 Qwen3.5 35B-A3B의 평균 82.9와 비교됨 |
이미지 분석


148
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.