Qwen3.6 MoE를 12.3GB로 만든 2-bit 빌드
텍스트 생성(text-generation, 코드 생성 및 추론 포함)35B (MoE, 256 experts)32K 컨텍스트apache-2.0
Qwen3.6-35B-A3B의 2-bit quantized MoE 체크포인트로 16–24 GB 소비자 GPU에서 로컬 서빙이 가능함
TL;DR
Qwen3.6-35B-A3B-Escha-W2는 Qwen3.6-35B-A3B MoE(256 experts)를 기반으로 한 mixed 2/3-bit per-projection 양자화와 int8 dense 조합으로 12.3 GB 크기로 배포된 2-bit 빌드입니다. SGLang과 ZML 두 런타임을 제공하며 SGLang은 동시성·structured output·tool calling을 지원하고 ZML은 단일 바이너리로 장문 생성에서 더 나은 지속 성능을 보이는 실행 경로를 제공합니다. 벤치마크는 대부분의 축에서 FP8 대비 동등하거나 근접한 성능을 보고하며, HumanEval+ pass@1 92.07과 MMLU-Pro 80.9% 같은 구체적 수치가 공개되어 실무적 성능 가늠이 가능합니다. 배포 관점에서는 16–24 GB 소비자 GPU에서 동작하도록 레시피와 튜닝 변수를 문서화해 로컬 서빙과 비용 절감에 초점을 맞춘 모델입니다.
핵심 역량
- 대화형 텍스트 생성과 도구 호출을 지원하며 OpenAI 호환 HTTP API로 로컬 서빙이 가능합니다. SGLang 엔진은 동시성, structured output, reasoning parser와 tool calling을 제공해 에이전트형 워크로드에 맞춤 설정이 용이합니다. ZML 엔진은 단일 바이너리로 Python 없이 장기 생성에서 더 높은 지속 성능을 내는 옵션을 제공합니다.
- 코드 생성과 코드 추론 성능이 우수하며 HumanEval+에서 pass@1 92.07, CRUXEval-O에서 정확도 61.75를 기록한 평가 결과를 함께 제공합니다. LiveCodeBench v6 서브셋에서는 pass@1 62.64로 FP8 대비 장기 코드 생성 영역에서 일부 손실이 관측됩니다. 평가 프로토콜은 thinking 모드의 영향과 토큰 예산을 명시하고 있어 재현 가능성이 높습니다.
- 대규모 컨텍스트 운영을 염두에 둔 설계로 최대 32k 컨텍스트를 런치 레시피로 지원하며 RULER 장기 컨텍스트 평가에서 128k까지 near-lossless 보존이 보고되어 있습니다. 컨텍스트와 동시성은 공유하는 KV 풀을 통해 소모되므로 16 GB 카드에서는 동시성 또는 컨텍스트 중 하나를 포기하는 트레이드오프가 있습니다. 런타임의 MEM, CTXLEN, MAXREQ 같은 변수를 조정해 원하는 워크로드 균형을 맞출 수 있습니다.
- 경량화된 12.3 GB 체크포인트로 16 GB 또는 24 GB 소비자 GPU에서 실행 가능해 배포 비용을 크게 낮춥니다. mixed 2/3-bit per-projection 양자화와 int8 dense 계층 조합으로 FP8 대비 평균 손실이 거의 없으며 다수 벤치마크에서 parity 또는 근접 성능을 보였습니다. 이로 인해 고성능 하드웨어 없이도 대형 MoE 모델을 로컬에서 운영할 수 있게 됩니다.
강점
- 압축된 2-bit 빌드임에도 주요 벤치마크 축에서 FP8 대비 평균 보존률이 약 100.2%로 보고되어 전반적 성능 손실이 제한적입니다. MATH-500과 GPQA-Diamond에서는 FP8 대비 오히려 소폭 우위를 보였고 MMLU-Pro도 80.9%로 높은 수준을 유지했습니다. 단, 장기 코드 생성(LiveCodeBench)에서만 유의미한 용량 한계가 확인되어 워크로드별 차등 영향이 존재합니다.
- 로컬 배포 관점에서는 체크포인트가 12.3 GB에 머물러 16 GB 소비자 GPU에서도 실행 가능한 점이 가장 큰 강점입니다. 16 GB 카드에서는 컨텍스트·동시성 중 선택을 통해 운영할 수 있고 24 GB 이상에서는 더 넉넉한 동시성과 긴 컨텍스트를 확보할 수 있습니다. 이로써 대형 MoE 모델을 고비용 인프라 없이도 실환경에 투입할 수 있는 실용성이 확보됩니다.
- 런타임과 레시피가 함께 제공되어 실제 서빙에 필요한 CUDA Graphs, RADIX, INT8 등 튜닝 포인트를 공개적으로 제시한 점이 실무 적용에서 유리합니다. RTX 4090/5090 등에서 얻은 수치들이 재현 가능한 명령으로 문서화되어 있어 성능 재현과 용량 계획이 수월합니다. 또한 SGLang은 동시성·도구 호출·structured output을 지원하므로 에이전트형 애플리케이션에 적합합니다.
알아두면 좋은 것
- 이 빌드는 Qwen3.6-35B-A3B MoE(256 experts)를 기반으로 한 2-bit 양자화체이며 저장 용량은 12.3 GB입니다. SGLang 엔진과 ZML 엔진을 함께 제공하며 SGLang은 동시성·structured output·tool calling을 지원하고 ZML은 의존성 없는 단일 바이너리로 단일 사용자 장기 생성에서 더 나은 지속 성능을 냅니다. 모델은 OpenAI 호환 `/v1` API로 포트 30000에서 동작하도록 패키지되어 있습니다.
- 품질 대 FP8 비교에서 평균 보존률이 약 100.2%로 보고되어 지식·수학·장기 컨텍스트 축에서 FP8과 동등하거나 근접한 성능을 유지합니다. MMLU-Pro 5-shot CoT에서 80.9%, MATH-500에서 93.8%, GPQA-Diamond에서 77.8% 같은 구체적 수치가 README에 실려 있습니다. 예외적으로 장기 코드 생성(LiveCodeBench)에서는 FP8 대비 retention이 떨어져 LiveCodeBench pass@1 62.64로 약간의 용량 민감성을 보였습니다.
- 서빙 성능 측정치는 SGLang 엔진에서 동일한 런처와 레시피로 획득되었으며 GPU별로 single-stream decode와 peak throughput을 상세히 제시합니다. 예를 들어 RTX 4090에서 225 tok/s single-stream과 1,321 tok/s peak(@bs32), RTX 5090에서는 283 tok/s single-stream과 ~2,670 tok/s peak가 보고되어 있습니다. CUDA Graphs, RADIX, INT8 같은 런타임 스위치가 성능에 큰 영향을 미치므로 제공된 레시피를 그대로 따르는 것이 재현성 확보에 중요합니다.
- 운영 관점에서 16 GB 카드의 경우 컨텍스트 대 동시성 트레이드오프가 명확히 설명되어 있고 MEM, CTXLEN, MAXREQ를 조정하는 레시피가 포함되어 있습니다. ZML은 greedy(temperature=0)에서 빠른 경로를 사용하지만 샘플링(temperature>0)에서는 속도 페널티가 있으므로 사용 사례에 따라 엔진을 선택해야 합니다. README는 또한 transformers 버전(>=5.8)과 torch 2.9.x 고정의 중요성 같은 실무적 주의를 강조하고 있습니다.
기술적 특징
- 양자화는 expert 투영에 mixed 2/3-bit 코드를, dense 계층에는 int8을 적용하는 하이브리드 방식으로 구현되어 있습니다. exporter는 per-projection 코드율을 기록하며 런타임은 그 코드율로부터 실제 복호화 및 연산 경로를 선택합니다. 이 방식은 모델 용적을 대폭 줄이면서도 주요 태스크에서의 성능 저하를 최소화하도록 설계되어 있습니다.
- 모델은 Qwen3.6-35B-A3B의 MoE 아키텍처(256 experts)를 바탕으로 하며 런타임은 expert 라우팅과 KV 풀 관리를 위해 MEM·CTXLEN·MAXREQ 같은 파라미터를 노출합니다. KV 풀은 컨텍스트와 동시성에 공통으로 자원을 소모하므로 16 GB 환경에서는 명확한 트레이드오프 조정이 필요합니다. 또한 GRAPHS=1(CUDA Graphs)은 하이브리드 MoE의 launch-bound 특성에서 필수 성능 레버로 제시됩니다.
- 배포 패키지는 OpenAI 호환 HTTP API를 제공하며 SGLang과 ZML 두 엔진을 통해 다양한 운영 요구를 충족합니다. SGLang은 Python 및 종속성 환경에서 동시성과 도구 연동을 제공하고 ZML은 의존성 없이 단일 프로세스 환경에서 장문 생성에 유리합니다. ZML의 greedy fast-path는 temperature=0에서만 적용되며 샘플링 시에는 속도 저하가 있으므로 사용 모드에 따른 엔진 선택이 중요합니다.
차별점
- 2-bit mixed quantization을 적용한 MoE 체크포인트를 12.3 GB로 패키지해 16–24 GB 소비자 GPU에서 실사용 가능한 수준으로 만든 점이 핵심 차별화입니다. 동일 아키텍처의 FP8 기준 빌드는 약 35 GB가 필요한데, 이 빌드는 하드웨어 요구를 크게 낮추면서도 대부분의 벤치마크에서 동급 성능을 유지합니다. 따라서 비용 민감한 엣지·온프레미스 배포에서 경쟁 우위를 가집니다.
- 런타임과 운영 레시피를 함께 제공해 실측 가능한 reproducible 성능 수치를 공개한 점도 눈에 띕니다. SGLang과 ZML 두 엔진의 장단점을 명확히 구분하고 GPU별 launch recipes를 문서화했기 때문에 실제 설치·튜닝 단계에서 시행착오를 크게 줄일 수 있습니다. 또한 OpenAI 호환 인터페이스를 통해 기존 도구와의 통합이 쉽습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| HumanEval+ | pass@1 | 92.07 | — |
| CRUXEval-O | accuracy | 61.75 | — |
| LiveCodeBench v6 (subset) | pass@1 | 62.64 | — |
| Commonsense-6 (avg) | accuracy | 76.06 | — |
| MMLU-Pro | accuracy | 80.9 | — |
| MATH-500 | accuracy | 93.8 | — |
| GPQA-Diamond | accuracy | 77.8 | — |
104
Likes
599
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.