본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

DavidAU/Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF

텍스트·이미지 입력 기반 생성, 코딩, reasoning, 창작 글쓰기, roleplay27B256K 컨텍스트apache-2.0

Qwen3.8-27B 기반 multi-stage merge GGUF로 reasoning token을 줄이고 코딩·에이전트 성능을 높인 모델

학습 방식 · Qwen3.8-27B 기반 multi-stage fine-tune·multi-state merge에 COLD FUSION(GAIN+Unsloth), Fable Fusion 711, Heretic ARA, Polar-STRICT·F451 데이터셋 튜닝을 결합했습니다.

TL;DR

Qwen3.8-27B를 기반으로 한 multi-stage fine-tune·multi-state merge GGUF 모델이며, Heretic의 ARA 처리와 COLD FUSION·Fable Fusion 711 학습을 결합했습니다. GAIN은 학습 중 샘플별로 훈련 방식을 동적으로 바꾸고, 추가 튜닝은 과도한 reasoning과 thinking token 소비를 줄이는 방향으로 진행됐습니다. README의 mxfp8 측정에서 ARC-C 0.735, ARC-E 0.882, LiveCodeBench v6 90.3을 기록했으며, MTP GGUF는 조건에 따라 생성 속도를 높일 수 있습니다. 256K context와 vision을 지원하지만, 이미지 입력에는 별도 mmproj 파일이 필요합니다.

핵심 포인트

  • COLD FUSION의 GAIN이 학습 중 샘플별 훈련을 동적으로 조정하고, Fable Fusion 711과 결합해 multi-stage 튜닝을 구성합니다.
  • xhigh·medium·low 세 reasoning 모드에서 thinking block을 줄이며, Jinja template의 reasoning_effort 값으로 모드를 바꿀 수 있습니다.
  • NEO IMATRIX와 출력 tensor의 16-bit 처리를 적용한 Regular·MTP GGUF를 제공해 양자화 상태의 정확도와 생성 속도를 조정합니다.
  • mxfp8 기준 ARC-C 0.735, ARC-E 0.882, QwenSWEBench 79.0으로 README에 기록된 기준 모델 수치를 웃돕니다.

제한사항

  • MTP GGUF는 token acceptance가 50% 미만이면 Regular GGUF보다 느릴 수 있습니다.
  • reasoning 수정이 모델 동작에 큰 변화를 주므로 실제 사용 목적에 맞춘 별도 테스트가 필요합니다.
  • vision 입력에는 GGUF와 같은 폴더에 별도 mmproj 파일을 내려받아야 합니다.

벤치마크

벤치마크지표비교
ARC-Cmxfp8 accuracy0.735Qwen3.8-27B mxfp8 0.591
ARC-Emxfp8 accuracy0.882Qwen3.8-27B mxfp8 0.782
BoolQmxfp8 accuracy0.917Qwen3.8-27B mxfp8 0.896
HSwagmxfp8 accuracy0.832Qwen3.8-27B mxfp8 0.746
OBQAmxfp8 accuracy0.530Qwen3.8-27B mxfp8 0.448
PIQAmxfp8 accuracy0.837Qwen3.8-27B mxfp8 0.801
WinoGrandemxfp8 accuracy0.785Qwen3.8-27B mxfp8 0.711
ARC-Cmxfp4 accuracy0.719README에 다른 mxfp4 벤치마크 수치는 미기재
Terminal Bench 2.1 (Terminus)score73.0
SWE-bench Proscore61.7
NL2Repo-Benchscore42.3
DeepSWE 1.1score42.2
QwenSWEBenchavg@379.0
CoWorkBenchscore70.7
Agents' Last ExamPass@120.4
Agents' Last ExamScore42.9
IFBenchscore79.5
GPQA Diamondscore89.2
HLEscore30.8
LiveCodeBench v6score90.3
OSWorld-Verifiedscore84.3
WebArena-Verifiedscore64.8
AndroidWorldscore81.9
RecreationBenchscore47.1
ClawEval-MMPass@357.4
ClawEval-MMAverage56.9

이미지 분석

Qwen 계열 5개 모델의 7개 상식·추론 벤치마크 점수를 비교한 막대그래프입니다.
그래프는 arc/c, arc/e, boolq, hswag, obkqa, piqa, wino에서 현재 모델의 막대가 대부분 가장 높게 나타나는 구성을 담고 있습니다. 특히 arc/c 약 0.735, arc/e 약 0.882, boolq 약 0.917, hswag 약 0.832 수준이며, obkqa에서는 약 0.530으로 상대적으로 낮은 점수를 기록합니다. README의 수치 표와 동일한 모델·벤치마크 비교를 시각화한 자료입니다.

88

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.