SyzygyResearch/Mach-1-Additive-35B
Qwen3.6-35B-A3B BF16 교사 대비 평균 95.0% 유지율을 보이는 Mach-1 계열의 additive 35B 모델
학습 방식 · README는 Mach-1 Small의 점수와 교사(Qwen3.6-35B-A3B BF16)의 점수를 나란히 제시하여 유지율(retention)을 핵심 지표로 삼는 실험을 보고하고 있습니다. 모델 ID에 포함된 "Additive" 표기는 파라미터를 추가하는 방식의 접근을 암시하나 구체적 학습 절차(SFT, LoRA, DPO, RLHF 등)와 하이퍼파라미터는 README에 명시되어 있지 않습니다. 따라서 공개된 자료를 기준으로는 교사와의 성능 보존을 목표로 한 학생 모델 구성이 핵심이며, 학습 방식의 세부 구현은 추가 문서가 필요합니다.
TL;DR
Mach-1-Additive-35B는 교사 모델 Qwen3.6-35B-A3B BF16과의 성능 보존을 목표로 한 additive 계열의 구성으로 README는 학생 모델(Mach-1 Small)의 점수와 교사 점수를 나란히 비교하여 유지율을 제시합니다. 12개 벤치마크 평균 유지율은 95.0%로 Ternary Bonsai 27B(93.6%)와 Gemma 4 Q2_K_XL(85.6%)보다 높게 보고되어 수치상 교사 성능을 잘 보존하는 편입니다. 속도 측정에서는 프롬프트 길이 128/2,048/8,192에 대해 각각 3.7s·5.5s·12.9s를 기록했고, 'Intelligence per second' 15.6 pts/s와 'Intelligence density per second' 1.97 pts/GB/s로 경쟁 모델보다 효율성이 높게 표시되어 실사용 시 처리량과 비용 측면에서 장점이 될 가능성이 큽니다. 다만 IFBench와 일부 항목에서는 유지율이 낮아 지시추종·대화형 작업에서 성능 손실이 상대적으로 클 수 있으며 학습·배포 세부 설정은 README에 충분히 기술되어 있지 않아 적용 전 추가 확인이 필요합니다.
핵심 포인트
- Mach-1-Additive-35B는 교사 모델로 표기된 Qwen3.6-35B-A3B BF16과의 성능 보존을 핵심 목표로 삼고 있으며, README는 학생 모델(Mach-1 Small)의 점수와 교사 점수를 대비해 유지율을 계산하는 방식으로 성능을 제시합니다. 평균 유지율은 95.0%로 표기되어 있고, 이는 Ternary Bonsai 27B의 93.6%와 Gemma 4 Q2_K_XL의 85.6%보다 높습니다. 이러한 구성은 작은 변화(또는 파라미터 효율적 추가)로 교사 성능을 최대한 보존하려는 설계 철학을 반영합니다.
- 개별 벤치마크별로는 AIME26 99.5%, MATH-500 99.4%처럼 수학·난이도 높은 문제에서 매우 높은 보존율을 보이는 반면, IFBench에서는 83.2%로 상대적으로 보존율이 낮습니다. Mach-1 Small의 절대 점수와 교사 점수 표도 제공되어 AIME26에서 89.58 대 90.00, IFBench에서 54.08 대 64.97처럼 어떤 과제에서는 교사와의 격차가 더 벌어짐을 확인할 수 있습니다. 이 패턴은 모델이 수리·코드 문제에서 강하게 유지되는 반면 일부 지시추종·지식 집약형 벤치마크에서 손실이 더 클 수 있음을 시사합니다.
- 속도 측정 그래프는 Mach-1 Small이 동일 작업 대비 응답 속도와 자원 효율 측면에서 우위를 가지는 지표를 포함하고 있습니다. 예시로 128-token 프롬프트에서 응답 시간 3.7s, 2,048-token에서 5.5s, 8,192-token에서 12.9s를 기록했고, 'Intelligence per second'는 Mach-1 Small 15.6 pts/s, Bonsai 9.2 pts/s, Gemma 4.7 pts/s로 표기되어 있습니다. 이런 수치는 실사용 관점에서 처리량과 비용을 고려할 때 Mach-1 Small이 경쟁 모델보다 유리할 가능성을 보여줍니다.
제한사항
- 벤치마크 평균 유지율은 95.0%로 경쟁 모델보다 높지만 벤치마크별 편차가 존재합니다. IFBench에서는 유지율 83.2%로 낮은 편이며 절대 점수도 54.08로 교사 모델의 64.97 대비 차이가 큽니다. 이로 인해 지시추종·대화형 난제에 대해 교사 대비 성능 손실이 더 클 수 있음을 유의해야 합니다.
- 일부 벤치마크에서 경쟁 모델이 우위를 보이는 항목이 존재합니다. 예컨대 GSM8K와 MBPP+에서는 Ternary Bonsai 27B가 Mach-1과 거의 근접하거나 더 높은 상대치를 보였고, BFCL-v3나 τ²-bench 같은 특정 항목에서도 상호 변화가 관찰됩니다. 따라서 작업별로는 Mach-1 Small이 항상 최선의 선택이 아닐 수 있으며, 목적에 맞춰 벤치마크별 결과를 비교해야 합니다.
- README에 프레임워크·세팅·라이선스 정보가 누락되어 있어 배포·배포 시 주의점과 통합 비용이 불명확합니다. 메타데이터에 qwen3_5_moe 태그가 있으나 구체적 호환성(예: HuggingFace Transformers, GGUF 등)은 명시되지 않아 실제 환경에 적용하기 전 추가 확인이 필요합니다. 운영 환경에서 메모리 요구량, KV 캐시 동작, 추론 엔진 호환성 같은 세부 조건을 검증해야 합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Mean retention, 12 benchmarks | Mean retention | 95.0% | — |
| Ternary Bonsai 27B (PrismML) | Mean retention | 93.6% | vs Mach-1 Small: -1.4% |
| Gemma 4 Q2_K_XL (Unsloth) | Mean retention | 85.6% | vs Mach-1 Small: -9.4% |
이미지 분석


78
Likes
71
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.