본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Qwen/Qwen3.8-Flash-Next-FP8

이미지와 텍스트를 함께 처리하는 멀티모달 대화 및 Agent 작업125B, 6B 활성화, 51B N-gram Embedding, 4B MTP262K 컨텍스트qwen-community-1.0

125B MoE에서 6B만 활성화하고 FP8으로 배포하는 멀티모달 모델

학습 방식 · Qwen3.8-Flash-Next 기반 사전 학습 및 Post-training 모델에 Muon과 AdamW를 가중치 유형별로 적용하고, 목표 batch size에서 바로 시작하는 학습 레시피를 사용했습니다.

TL;DR

Qwen3.8-Flash-Next-FP8은 Qwen3.8-Flash-Next를 fine-grained FP8, block size 128로 양자화한 Transformers 모델입니다. 전체 125B 파라미터 중 6B를 활성화하는 MoE와 51B N-gram Embedding을 사용해 대규모 파라미터 용량과 낮은 활성 연산량을 함께 구성했습니다. Gated DeltaNet과 Qwen Sparse Attention을 결합하고 QSA가 2048 토큰 예산 안에서 마이크로 블록을 선택해 262,144 토큰 기본 컨텍스트와 최대 1,000,000 토큰 확장을 지원합니다. README에 공개된 원본 모델 수치는 SWE-bench Pro 62.5, AndroidWorld 84.5, RealWorldQA 88.5이며, FP8 버전은 원본과 성능 지표가 거의 같다고 안내됩니다.

핵심 포인트

  • Qwen3.8-Flash-Next 기반으로 전체 125B 중 6B만 활성화하는 MoE 구조입니다.
  • QSA가 토큰 대신 마이크로 블록을 선택해 긴 컨텍스트의 Attention 비용을 줄입니다.
  • Gated DeltaNet과 Qwen Sparse Attention을 결합해 선형 처리와 선택적 전역 처리를 나눕니다.
  • bigrams·trigrams 기반 51B N-gram Embedding으로 연산 부담을 낮추며 파라미터를 확장합니다.

제한사항

  • 이 저장소는 원본 Qwen3.8-Flash-Next의 FP8 양자화 가중치와 설정 파일을 담은 실험적 미리보기입니다. fine-grained FP8을 block size 128로 적용했으며 원본과 성능 지표가 거의 같다고 안내하지만, README는 FP8 모델 자체의 별도 벤치마크를 제공하지 않습니다. 따라서 공개된 벤치마크 수치를 이 저장소의 FP8 측정값으로 직접 간주하기 어렵습니다.
  • 로컬 모델의 기본 컨텍스트 길이는 262,144 토큰이며 1,000,000 토큰은 확장 가능한 상한으로만 제시됩니다. 1M 컨텍스트와 내장 도구를 기본 제공하는 Qwen3.8-Flash는 별도의 Qwen Cloud 공식 버전입니다. 로컬 Transformers·vLLM·SGLang 배포에서 동일한 운영 기능을 기대하려면 별도 구성이 필요합니다.

벤치마크

벤치마크지표비교
DeepSWE 1.1score58.7README의 원본 Qwen3.8-Flash-Next 공개 수치이며 FP8 양자화 버전의 자체 측정값 아님; Qwen3.8-27B 42.2, DeepSeek-V4-Flash-0731 54.4
SWE-bench Proscore62.5README의 원본 Qwen3.8-Flash-Next 공개 수치이며 FP8 양자화 버전의 자체 측정값 아님; Qwen3.8-27B 61.7, Claude-Opus-4.6 (Max) 53.4
SWE-bench Multilingualscore81.0README의 원본 Qwen3.8-Flash-Next 공개 수치이며 FP8 양자화 버전의 자체 측정값 아님; Qwen3.8-27B 73.8, Qwen3.7-Plus 75.8
CoWorkBenchscore73.9README의 원본 Qwen3.8-Flash-Next 공개 수치이며 FP8 양자화 버전의 자체 측정값 아님; Qwen3.8-27B 70.7, Claude-Opus-4.6 (Max) 68.2
Toolathlon VerifiedPass@173.5README의 원본 Qwen3.8-Flash-Next 공개 수치이며 FP8 양자화 버전의 자체 측정값 아님; Qwen3.8-27B 67.1, DeepSeek-V4-Flash-0731 70.3
IFBenchscore81.3README의 원본 Qwen3.8-Flash-Next 공개 수치이며 FP8 양자화 버전의 자체 측정값 아님; Qwen3.8-27B 79.5, Qwen3.7-Plus 79.1
GPQA Diamondscore91.7README의 원본 Qwen3.8-Flash-Next 공개 수치이며 FP8 양자화 버전의 자체 측정값 아님; Qwen3.8-27B 89.2, Claude-Opus-4.6 (Max) 91.3
LiveCodeBench v6score91.9README의 원본 Qwen3.8-Flash-Next 공개 수치이며 FP8 양자화 버전의 자체 측정값 아님; Qwen3.8-27B 90.3, Claude-Opus-4.6 (Max) 88.8
ClawEval-MMPass@3 / Average64.4 / 60.4README의 원본 Qwen3.8-Flash-Next 공개 수치이며 FP8 양자화 버전의 자체 측정값 아님; Qwen3.8-27B 57.4 / 56.9
AndroidWorldscore84.5README의 원본 Qwen3.8-Flash-Next 공개 수치이며 FP8 양자화 버전의 자체 측정값 아님; Qwen3.8-27B 81.9, Claude-Opus-4.6 (Max) 62.0
OSWorld 2.0Binary / Partial19.4 / 52.3README의 원본 Qwen3.8-Flash-Next 공개 수치이며 FP8 양자화 버전의 자체 측정값 아님; Qwen3.8-27B 19.4 / 48.0
RealWorldQAscore88.5README의 원본 Qwen3.8-Flash-Next 공개 수치이며 FP8 양자화 버전의 자체 측정값 아님; Qwen3.8-27B 85.9, Qwen3.7-Plus 86.9
MathVisionWithout CI / With CI90.6 / 95.7README의 원본 Qwen3.8-Flash-Next 공개 수치이며 FP8 양자화 버전의 자체 측정값 아님; Qwen3.8-27B 90.0 / 94.6
LVBenchscore76.6README의 원본 Qwen3.8-Flash-Next 공개 수치이며 FP8 양자화 버전의 자체 측정값 아님; Qwen3.8-27B 72.4, Qwen3.7-Plus 76.2

이미지 분석

Qwen3.8-Flash-Next의 GDN Layer와 QSA Layer를 반복 배치하고, MoE·Gated Residual·N-gram Embedding을 연결한 전체 아키텍처도입니다.
도식은 하위 블록에서 Gated DeltaNet과 MoE를 세 번 반복한 뒤 QSA와 MoE 블록을 한 번 배치하는 Hybrid Block 구조를 나타냅니다. QSA 내부에는 Qwen Sparse Attn이, GDN 내부에는 Gated DeltaNet이 연결되며 GR Read·GR Write가 residual 흐름을 조절합니다. Layer 2에만 N-gram Embedding을 추가하고, 상단에서 GR Read를 거쳐 MTP Modules와 Prediction Head로 출력을 전달합니다.

91

LIKES

451

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.