본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

unsloth/Qwen3.8-Flash-Next-GGUF

이미지와 텍스트를 함께 처리하는 Vision-Language Causal Language Model이며, agentic coding·tool use·장문 문맥 처리에 초점을 둡니다.125B 전체, 6B 활성화, 51B N-gram embedding 및 4B MTP 포함262K 컨텍스트qwen-community-1.0

Qwen3.8-Flash-Next 기반 GGUF로 장문·멀티모달 agent 작업을 겨냥한 모델

학습 방식 · Qwen/Qwen3.8-Flash-Next 기반의 GGUF 양자화 배포 모델이며, 기반 모델은 Pre-training과 Post-training을 거쳤습니다. 기반 학습에서는 weight category별로 Muon과 AdamW를 적용하고, target batch size에서 바로 시작하는 학습 방식을 사용했습니다. GGUF 변환에 사용한 정확한 Dynamic 3.0 양자화 설정은 이 README에 별도로 기재되지 않았습니다.

TL;DR

unsloth/Qwen3.8-Flash-Next-GGUF는 Qwen/Qwen3.8-Flash-Next를 GGUF로 양자화한 image-text-to-text 모델이며, 원본은 125B 파라미터 중 6B만 활성화하는 Causal Language Model with Vision Encoder입니다. Qwen Sparse Attention은 최대 512개 block 또는 2048토큰 예산으로 장문 입력을 선택 처리하고, Gated DeltaNet·Gated Residual·512-expert MoE·51B N-gram Embedding을 결합해 계산량과 메모리 사용을 조절합니다. 기본 문맥 길이는 262,144토큰이고 최대 1,000,000토큰까지 확장되며, 기반 모델 공개 수치에서 SWE-bench Pro 62.5, Toolathlon Verified Pass@1 73.5, ClawEval-MM Pass@3 64.4를 기록했습니다. 다만 이 수치는 GGUF 양자화 파일의 재측정 결과가 아니라 기반 모델 README에서 인용한 값이며, 실행에는 llama.cpp PR 27742 또는 Unsloth Desktop이 필요합니다.

핵심 포인트

  • Qwen3.8-Flash-Next를 GGUF로 양자화한 배포 모델입니다. 원본은 125B 파라미터 중 6B만 활성화하는 구조이며, 이 저장소의 양자화 세부 비트폭과 파일별 용량은 README에 명시되지 않았습니다. 따라서 공개 성능 수치는 이 GGUF 파일 자체가 아니라 기반 모델에 인용된 값으로 봐야 합니다.
  • Qwen Sparse Attention은 토큰 하나씩 고르는 대신 최대 512개 micro-block 또는 2048토큰 예산으로 장문 입력을 처리합니다. Gated DeltaNet과 QSA를 함께 배치해 선형 attention 경로와 선택적 sparse attention 경로를 결합합니다. 이 구성은 262,144토큰 기본 문맥과 최대 1,000,000토큰 확장성을 겨냥합니다.
  • 51B 규모의 N-gram Embedding을 layer 2에서 bigram과 trigram 조회 방식으로 사용합니다. 짧은 n-gram 인덱싱으로 대규모 embedding 파라미터를 계산량과 offloading 부담이 상대적으로 낮은 축으로 확장합니다. 모델 개요에는 20,000,000개 n-gram embedding 항목이 기재되어 있습니다.
  • Gated Residual은 widened residual stream에 data-dependent element-wise read gate와 branch별 scalar write gate를 적용합니다. 4개 branch와 bottleneck rank 320으로 정보 흐름을 조절하면서 residual 기반 학습 안정성을 유지하도록 설계했습니다. 512개 expert 중 10개 routed expert와 1개 shared expert만 활성화하는 MoE 구성도 함께 사용합니다.

제한사항

  • 실험적 preview 아키텍처이므로 Qwen3.8-Flash-Next의 후속 구조 검증 단계에 해당하며, 운영 환경에서의 안정성이 별도로 보장되지는 않습니다.
  • 실행에는 llama.cpp PR 27742 또는 Unsloth Desktop이 필요하다고 안내되어 있어, 일반적인 GGUF 런타임과의 호환성을 사전에 확인해야 합니다.
  • README의 benchmark 표는 기반 Qwen3.8-Flash-Next 결과이며 이 양자화 파일에서 재측정한 값이 아닙니다. 또한 저장소 메타데이터의 다운로드 수는 0으로 표시되어 실제 배포 사용량을 판단하기 어렵습니다.

벤치마크

벤치마크지표비교
DeepSWE 1.1score58.7기반 모델 README의 공개 수치이며, Qwen3.8-27B 42.2·Qwen3.7-Plus 16.5·DeepSeek-V4-Flash-0731 54.4와 비교한 값으로 GGUF 자체 측정치가 아님
SWE-bench Proscore62.5기반 모델 README의 공개 수치이며, Qwen3.8-27B 61.7·Qwen3.7-Plus 55.8·DeepSeek-V4-Flash-0731 56.0·Claude-Opus-4.6 (Max) 53.4와 비교한 값으로 GGUF 자체 측정치가 아님
SWE-bench Multilingualscore81.0기반 모델 README의 공개 수치이며, Qwen3.8-27B 73.8·Qwen3.7-Plus 75.8·Claude-Opus-4.6 (Max) 77.5와 비교한 값으로 GGUF 자체 측정치가 아님
CoWorkBenchscore73.9기반 모델 README의 공개 수치이며, Qwen3.8-27B 70.7·Qwen3.7-Plus 65.1·DeepSeek-V4-Flash-0731 45.1·Claude-Opus-4.6 (Max) 68.2와 비교한 값으로 GGUF 자체 측정치가 아님
Toolathlon VerifiedPass@173.5기반 모델 README의 공개 수치이며, Qwen3.8-27B 67.1·Qwen3.7-Plus 50.6·DeepSeek-V4-Flash-0731 70.3과 비교한 값으로 GGUF 자체 측정치가 아님
IFBenchscore81.3기반 모델 README의 공개 수치이며, Qwen3.8-27B 79.5·Qwen3.7-Plus 79.1·DeepSeek-V4-Flash-0731 79.2·Claude-Opus-4.6 (Max) 62.5와 비교한 값으로 GGUF 자체 측정치가 아님
GPQA Diamondaccuracy91.7기반 모델 README의 공개 수치이며, Qwen3.8-27B 89.2·Qwen3.7-Plus 90.3·DeepSeek-V4-Flash-0731 90.8·Claude-Opus-4.6 (Max) 91.3과 비교한 값으로 GGUF 자체 측정치가 아님
LiveCodeBench v6score91.9기반 모델 README의 공개 수치이며, Qwen3.8-27B 90.3·Qwen3.7-Plus 89.6·DeepSeek-V4-Flash-0731 90.6·Claude-Opus-4.6 (Max) 88.8과 비교한 값으로 GGUF 자체 측정치가 아님
ClawEval-MMPass@3 / Average64.4 / 60.4기반 모델 README의 공개 수치이며, Qwen3.8-27B 57.4 / 56.9·Qwen3.7-Plus 57.4 / 60.1·Claude-Opus-4.6 (Max) 52.5 / 54.7과 비교한 값으로 GGUF 자체 측정치가 아님
AndroidWorldscore84.5기반 모델 README의 공개 수치이며, Qwen3.8-27B 81.9·Qwen3.7-Plus 81.0·Claude-Opus-4.6 (Max) 62.0과 비교한 값으로 GGUF 자체 측정치가 아님
OSWorld 2.0Binary / Partial19.4 / 52.3기반 모델 README의 공개 수치이며, Qwen3.8-27B 19.4 / 48.0·Qwen3.7-Plus 2.8 / 21.5와 비교한 값으로 GGUF 자체 측정치가 아님
RealWorldQAscore88.5기반 모델 README의 공개 수치이며, Qwen3.8-27B 85.9·Qwen3.7-Plus 86.9·Claude-Opus-4.6 (Max) 73.9와 비교한 값으로 GGUF 자체 측정치가 아님

이미지 분석

Qwen3.8-Flash-Next가 Gated DeltaNet과 Qwen Sparse Attention을 결합한 Hybrid Block을 반복하고, Gated Residual·MoE·N-gram Embedding·MTP를 연결한 구조를 나타낸 다이어그램입니다.
이미지는 하단의 Vocabulary Embedding과 layer 2 전용 N-gram Embedding에서 시작한 hidden states가 GDN Layer 3회와 QSA Layer 1회를 거치는 Hybrid Block으로 이어지는 흐름을 나타냅니다. 각 블록 안에서는 GR Read와 GR Write가 residual 경로를 조절하고, GDN 쪽에는 Gated DeltaNet, QSA 쪽에는 Qwen Sparse Attn과 MoE가 배치되며 상단에서 Prediction Head와 MTP Modules로 분기됩니다. 따라서 이 모델의 핵심은 모든 토큰에 동일한 full attention을 적용하기보다 선형 상태 업데이트, block 단위 sparse attention, gated residual, sparse expert 경로를 조합해 장문 문맥과 agent 작업을 처리하는 데 있습니다.

317

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.