본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

unsloth/Qwen3.8-2.4T-A95B-GGUF

텍스트 생성 및 장문 추론2.4T 전체, 95B 활성화262K 컨텍스트qwen3.8-max

2.4T MoE 구조와 장문 Thinking을 결합한 Qwen3.8 GGUF 양자화 모델

학습 방식 · Qwen/Qwen3.8-2.4T-A95B 기반의 post-trained 모델을 Unsloth Dynamic 2.0 방식으로 GGUF 양자화한 변환본입니다. README는 Qwen3.8이 pre-training과 post-training을 거쳤다고 밝히지만, 이 저장소 자체의 추가 Fine-tuning 방식은 명시하지 않습니다.

TL;DR

이 모델은 Qwen/Qwen3.8-2.4T-A95B를 기반으로 Unsloth Dynamic 2.0 방식으로 변환한 GGUF 양자화 모델이며, 전체 2.4T 파라미터 중 95B를 활성화하는 MoE 구조를 사용합니다. Gated DeltaNet과 Gated Attention을 결합하고 512개 Expert 중 10개 Routed Expert와 1개 Shared Expert를 선택해 텍스트 생성과 장기 Agent 작업을 처리합니다. Thinking 모드가 항상 켜지고 reasoning_effort로 추론 깊이를 조절하며, Context Length는 기본 262,144토큰에서 최대 1,010,000토큰까지 확장됩니다. README 기준 Terminal Bench 2.1에서 86.6, PaperBench에서 93.0, IFBench에서 82.8을 기록했지만 이미지 입력과 Thinking 비활성화는 지원하지 않습니다.

핵심 포인트

  • Qwen3.8-2.4T-A95B를 기반으로 Unsloth Dynamic 2.0 방식으로 변환한 GGUF 양자화 모델입니다. 전체 2.4T 파라미터 중 95B만 활성화하는 MoE 구조를 사용합니다. 로컬 추론 환경에서 모델 크기와 연산량을 줄이는 목적에 맞습니다.
  • 512개 Expert 중 라우팅 Expert 10개와 Shared Expert 1개를 활성화합니다. Gated DeltaNet과 Gated Attention을 결합해 92개 Layer를 구성합니다. 긴 문맥 처리와 선택적 Expert 계산을 함께 겨냥한 설계입니다.
  • 모든 상호작용에서 Thinking 모드가 활성화되며 reasoning_effort로 추론 깊이를 조절합니다. xhigh, medium, low 세 단계를 제공하고 preserve_thinking은 기본 활성화 상태입니다. 이미지 입력과 Thinking 비활성화는 지원하지 않습니다.
  • 네이티브 Context Length는 262,144토큰이며 최대 1,010,000토큰까지 확장할 수 있습니다. Reasoning Content에 최대 262,144토큰, 최종 응답에 최대 131,072토큰을 할당하도록 권장합니다. 장기 Agent 작업과 대규모 코드베이스 처리에 적합한 설정입니다.

제한사항

  • 텍스트 전용 모델이라 이미지나 기타 멀티모달 입력을 처리하지 못합니다. 모든 응답이 <think> 블록을 포함하는 Thinking 모드로 시작합니다. Thinking을 끌 수 없으므로 짧은 응답이나 낮은 지연이 필요한 작업에는 부적합할 수 있습니다.
  • 전체 파라미터가 2.4T이고 활성 파라미터도 95B에 달합니다. GGUF 양자화가 메모리 요구량을 낮추는 방향이지만 실제 실행 비용과 지원되는 Sampling Parameter는 추론 Framework에 따라 달라집니다. 배포 전 사용 환경에서 호환성을 확인해야 합니다.

벤치마크

벤치마크지표비교
Terminal Bench 2.1score86.6Qwen3.7-Max 74.5, GPT 5.6 Sol 88.8
SWE-bench Proscore67.7Qwen3.7-Max 60.6, Opus 4.8 69.2
PaperBenchscore93.0Qwen3.7-Max 64.8, GPT 5.6 Sol 90.5
IFBenchscore82.8Qwen3.7-Max 79.1, Opus 4.8 62.2
MRCR v2 256K (8-needle)score92.9Qwen3.7-Max 86.7, GPT 5.6 Sol 93.8
LongBench v2score66.3Qwen3.7-Max 65.3, GPT 5.6 Sol 67.1
HealthBenchscore60.2Qwen3.7-Max 54.5, GPT 5.6 Sol 55.3
WideSearchscore81.9Qwen3.7-Max 75.2, Fable 5 81.2

90

Likes

0

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.