EschaLabs/Qwen3.8-27B-Escha-W2
Qwen3.8-27B를 10.15GB로 압축해 24GB GPU에서 64k context와 reasoning을 실행하는 escha 2-bit 모델입니다.
학습 방식 · Qwen/Qwen3.8-27B를 기반으로 escha 혼합 2·3-bit quantization을 적용했으며, 400개 projection을 양자화하고 embedding·output head는 int8로 저장했습니다.
TL;DR
EschaLabs/Qwen3.8-27B-Escha-W2는 Qwen/Qwen3.8-27B를 평균 2.469 bits/weight의 escha 혼합 2·3-bit 방식으로 양자화한 27B text-generation checkpoint입니다. 가중치 10.15GB로 줄여 24GB 소비자용 GPU에서 모델과 KV cache, 64k context를 함께 구동하며 전용 SGLang runtime과 CUDA decode kernel을 사용합니다. 동일 backend의 FP8 reference와 비교해 Commonsense-6 79.25, GPQA-Diamond 88.38, LiveCodeBench v6 pass@1 86.81을 기록해 측정한 범위에서는 큰 품질 손실이 나타나지 않았습니다. Thinking mode는 요청별로 켤 수 있고, RTX 4090에서는 단일 사용자 67.0 tok/s와 16개 stream 기준 649 tok/s를 기록하지만 64k 초과 문맥의 품질과 이미지 입력은 검증·지원 범위에 포함되지 않습니다.
핵심 포인트
- Qwen3.8-27B를 escha 방식으로 2-bit 양자화해 27B 파라미터 가중치를 10.15GB에 담았습니다. 혼합 2·3-bit projection과 int8 embedding·output head를 사용해 평균 2.469 bits/weight를 구현했습니다. 24GB GPU 한 장에서 모델과 KV cache, 64k context를 함께 구동할 수 있습니다.
- 전용 SGLang runtime과 CUDA decode kernel이 필요한 배포형 checkpoint입니다. `torch==2.9.*`, `transformers>=5.8`, NVIDIA sm_80 이상 환경을 요구하며 OpenAI-compatible HTTP server로 제공합니다. RTX 4090에서 단일 사용자 decode 67.0 tok/s, 16개 stream에서 649 tok/s를 기록했습니다.
- Thinking mode를 `chat_template_kwargs`의 `enable_thinking`과 `reasoning_effort`로 제어합니다. `xhigh`는 기본값이며 GPQA-Diamond와 LiveCodeBench 측정에는 28k-token thinking budget을 적용했습니다. thinking-on 기준 GPQA-Diamond accuracy 88.38, LiveCodeBench pass@1 86.81을 기록했습니다.
제한사항
- 이 checkpoint는 text-only라 이미지 입력을 처리하지 못합니다. `qwen3_5` 설정에 vision tower 항목이 있지만 양자화 가중치에는 `visual.*` tensor가 없고 runtime도 `SGLANG_VLM_TEXT_ONLY=1`로 tower를 비활성화합니다. 이미지 요청은 지원 범위 밖입니다.
- 일반 loader만으로는 재현이 어렵고 Escha 전용 SGLang runtime이 필요합니다. `escha_code` 계열 tensor를 처리하는 decode kernel과 `transformers>=5.8`이 요구되며, 잘못된 attention path에서는 유창하지만 부정확한 출력이 발생할 수 있습니다. 소비자용 Blackwell GPU에서는 `ATTN_BACKEND=triton` 설정도 필요합니다.
- 128k 이상에서 긴 문맥이 동작하더라도 retrieval 품질은 검증되지 않았습니다. 120k-token 입력의 coherent continuation은 측정됐지만 정확한 검색 성능의 근거는 아니며, prefix caching도 대화가 새로 이어지는 append 요청에는 재사용되지 않습니다. 장문 agent loop에서는 매 turn 전체 prefill 비용을 다시 부담할 수 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Commonsense-6 | avg accuracy, thinking-off | 79.25 | 동일 SGLang backend의 Qwen3.8-27B FP8 reference 77.96 대비 +1.29점이며, 양자화 모델 자체 측정값이다. |
| GPQA-Diamond | accuracy, thinking-on, 28k budget | 88.38 | 동일 SGLang backend의 FP8 reference 88.89 대비 −0.51점이며, 198문항 중 1문항 차이로 저자는 실질적 동률로 해석한다. |
| LiveCodeBench v6 | pass@1, thinking-on, 28k budget | 86.81 | 동일 SGLang backend의 FP8 reference 85.16 대비 +1.65점이며, 자체 bootstrap σ 2.51 percentage points 안에 있어 유의한 우위로 단정할 수 없다. |
100
Likes
561
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.