본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Qwen/Qwen3.8-2.4T-A95B-FP8

대규모 text-generation과 reasoning, coding agent, 장기 에이전트 작업을 처리하는 Causal Language Model입니다.총 2.4T, 활성 95B네이티브 262,144토큰, 최대 1,010,000토큰까지 확장 가능 컨텍스트qwen3.8-max

2.4T MoE를 95B 활성 계산과 FP8 가중치로 배포하는 장문맥 reasoning 모델

학습 방식 · Qwen/Qwen3.8-2.4T-A95B의 pre-training 및 post-training 모델을 fine-grained FP8 양자화하고 Block size 128로 저장한 Transformers 배포판입니다.

TL;DR

Qwen3.8-2.4T-A95B-FP8은 Qwen/Qwen3.8-2.4T-A95B를 Block size 128의 fine-grained FP8 방식으로 양자화한 text-only reasoning 모델입니다. 전체 2.4T 파라미터 중 95B만 활성화하는 512-Expert MoE와 Gated DeltaNet·Gated Attention 혼합 구조를 사용해 대규모 모델 용량과 토큰별 계산을 분리합니다. 네이티브 262,144토큰 문맥과 최대 1,010,000토큰 확장을 지원하며 reasoning_effort로 추론 깊이를 조절할 수 있습니다. README의 Qwen3.8-Max 공개 수치는 Terminal Bench 2.1 86.6, PaperBench 93.0, IFBench 82.8, MRCR v2 256K 92.9로 에이전트·코딩·긴 문맥 작업에 초점을 둡니다.

핵심 포인트

  • 총 2.4T 파라미터 중 95B만 활성화하는 MoE 구조로 계산량과 모델 규모를 분리합니다. 512개 Expert 중 10개 Routed Expert와 1개 Shared Expert를 선택합니다. 거대한 전체 용량을 유지하면서 토큰마다 일부 Expert만 처리하는 설계입니다.
  • Gated DeltaNet과 Gated Attention을 교차 배치해 긴 문맥 처리와 주의집중 계산을 구성합니다. 92개 Layer가 23개 블록으로 묶이며 각 블록은 3개의 Gated DeltaNet 경로와 1개의 Gated Attention 경로를 포함합니다. 네이티브 문맥 길이는 262,144토큰이고 최대 1,010,000토큰까지 확장할 수 있습니다.
  • 이 저장소는 Qwen/Qwen3.8-2.4T-A95B를 기반으로 한 fine-grained FP8 양자화 모델입니다. Block size 128을 사용해 Transformers 형식의 FP8 가중치와 설정 파일을 제공하며 vLLM, SGLang, TokenSpeed과 호환됩니다. README는 원본 모델과 성능 지표가 거의 동일하다고 밝힙니다.
  • 모든 상호작용이 thinking mode로 실행되며 reasoning_effort로 추론 깊이를 xhigh, medium, low 중에서 조절합니다. preserve_thinking은 기본 활성화되어 이전 메시지의 reasoning context를 유지합니다. 텍스트 전용 모델이므로 multimodal 입력을 지원하지 않고 thinking을 끌 수 없습니다.

제한사항

  • 총 파라미터가 2.4T이고 활성 파라미터도 95B이므로 로컬 배포에는 큰 하드웨어와 효율적인 serving engine이 필요합니다. README는 고처리량 운영에 SGLang, vLLM 또는 TokenSpeed을 권장합니다. 실제 inference efficiency와 throughput은 framework 버전에 따라 크게 달라집니다.
  • 이 모델은 text-only 구성이라 이미지 같은 multimodal 입력을 처리하지 못합니다. 모든 상호작용에서 thinking mode가 필요하고 비활성화할 수 없습니다. 응답에는 자동으로 <think>...</think> 형식의 reasoning이 먼저 생성되므로 지연 시간과 출력 예산을 함께 고려해야 합니다.

벤치마크

벤치마크지표비교
Terminal Bench 2.1score86.6README 표의 Qwen3.8-Max 공개 수치이며 FP8 저장소 자체의 별도 측정치가 아닙니다.
SWE-bench Proscore67.7README 표의 Qwen3.8-Max 공개 수치이며 Qwen3.7-Max 60.6보다 높습니다. FP8 저장소 자체의 별도 측정치는 아닙니다.
PaperBenchscore93.0README 표의 Qwen3.8-Max 공개 수치이며 Qwen3.7-Max 64.8보다 높습니다. FP8 저장소 자체의 별도 측정치는 아닙니다.
QwenSWEBenchscore80.7README 표의 Qwen3.8-Max 공개 수치이며 Qwen3.7-Max 63.4보다 높습니다. FP8 저장소 자체의 별도 측정치는 아닙니다.
IFBenchscore82.8README 표의 Qwen3.8-Max 공개 수치이며 Qwen3.7-Max 79.1보다 높습니다. FP8 저장소 자체의 별도 측정치는 아닙니다.
HealthBenchscore60.2README 표의 Qwen3.8-Max 공개 수치이며 Qwen3.7-Max 54.5보다 높습니다. FP8 저장소 자체의 별도 측정치는 아닙니다.
MRCR v2 256K (8-needle)score92.9README 표의 Qwen3.8-Max 공개 수치이며 Qwen3.7-Max 86.7보다 높습니다. FP8 저장소 자체의 별도 측정치는 아닙니다.
LongBench v2score66.3README 표의 Qwen3.8-Max 공개 수치이며 Qwen3.7-Max 65.3보다 높습니다. FP8 저장소 자체의 별도 측정치는 아닙니다.

107

Likes

3.9k

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.