본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF

Qwen3.8-27B의 텍스트·추론·에이전트·이미지·비디오 처리를 GGUF 환경에서 실행하는 다중모달 생성 모델입니다.27B262K 컨텍스트apache-2.0

Qwen3.8-27B 기반 Aggressive GGUF에 FastMTP 가속과 Vision projector를 결합했습니다.

학습 방식 · Qwen/Qwen3.8-27B 기반의 GGUF 양자화 변형이며, 데이터셋 변경 없이 HauhauCS Aggressive uncensoring profile과 내장 MTP 보존 및 별도 FastMTP 가속 sidecar를 적용했습니다.

TL;DR

이 모델은 Qwen/Qwen3.8-27B를 기반으로 Aggressive uncensoring profile을 적용한 GGUF 양자화 변형으로, 텍스트·추론·이미지·비디오 기능과 native NextN head를 유지합니다. 별도 FastMTP 32K sidecar와 패치된 llama.cpp를 사용하면 초안 토큰을 먼저 만들고 원본 target model이 검증하는 speculative decoding으로 생성 속도를 높입니다. README 공개 측정에서 Q8_K_P는 MTP 비활성화 대비 문서 생성 최대 3.02배, 추론 생성 최대 1.93배를 기록했으며, Vision 입력에는 BF16 projector가 필요합니다. 262,144토큰 native context와 다양한 10.32~31.46GB급 양자화 파일을 제공하지만, 긴 컨텍스트와 FastMTP 실행에는 큰 VRAM과 전용 런타임 구성이 요구됩니다.

핵심 포인트

  • Qwen3.8-27B를 기반으로 Aggressive uncensoring profile을 적용한 양자화 변형입니다. 데이터셋이나 기본 기능은 변경하지 않고 직접적인 응답과 최소한의 사전 설명을 지향합니다. README는 465개 테스트에서 거부 0회를 기록했다고 밝힙니다.
  • 모든 텍스트 GGUF에 Qwen3.8의 native NextN head를 유지하고 별도 FastMTP sidecar를 결합합니다. FastMTP는 초안 토큰을 생성한 뒤 변경되지 않은 target model이 토큰을 검증하는 speculative decoding 방식으로 작동합니다. 전용 llama.cpp patch와 32K sidecar가 필요합니다.
  • Q4_K_P부터 Q8_K_P와 IQ 계열까지 여러 양자화 파일을 제공하며 K_P는 모델별로 중요한 가중치를 선택 보존하는 custom quantization입니다. 텍스트 모델 용량은 Q4_K_P 17.92GB부터 Q8_K_P 31.46GB까지입니다. 이미지와 비디오 입력에는 별도 931MB BF16 vision projector를 추가해야 합니다.
  • native context는 262,144토큰이며 프레임워크 설정에 따라 최대 1,000,000토큰까지 확장할 수 있다고 기재되어 있습니다. FastMTP는 204800 설정 컨텍스트와 RTX PRO 6000 Blackwell 96GB에서 Q8_K_P 기준 문서 생성 138.18 tok/s, 추론 생성 90.07 tok/s를 기록했습니다. 긴 컨텍스트와 KV precision은 VRAM 사용량을 크게 늘리므로 실제 하드웨어에 맞춘 조정이 필요합니다.

제한사항

  • Aggressive profile은 직접 응답과 비거부 동작을 우선하므로 신뢰성이 중요한 장기 에이전트 작업에는 README가 Balanced release를 더 안전한 기본값으로 안내합니다. 이는 거부 동작을 줄이는 조정과 관련된 사용 범위의 차이입니다. Balanced release의 실제 제공 여부나 성능 수치는 README에 제시되지 않았습니다.
  • FastMTP는 일반 GGUF 실행만으로 활성화되지 않으며, 전용 32K sidecar와 HauhauCS-FastMTP-llama.cpp.patch가 필요합니다. 현재 Qwen3.8/MTP 지원 llama.cpp를 checkout하고 patch를 적용한 뒤 빌드해야 합니다. LM Studio와 기타 GGUF frontend는 포함된 llama.cpp 버전에 따라 MTP와 Vision 호환성이 달라집니다.
  • Vision 입력에는 텍스트 GGUF와 별도로 BF16 projector가 필요하고, K_P 양자화는 일부 UI에서 quant 열이 ?로 표시될 수 있습니다. 이 표시는 로딩 실패가 아니라 UI 인식 문제라고 README에 적혀 있습니다. 컨텍스트 길이와 KV precision을 높이면 VRAM 비용이 커지므로 메모리 압박 시 먼저 컨텍스트를 줄이도록 안내합니다.

벤치마크

벤치마크지표비교
FastMTP 대 MTP 비활성화, 문서generation throughput최대 3.02x (+202.0%)README의 HauhauCS Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF 공개 측정치이며, Q8_K_P·depth 3·RTX PRO 6000 Blackwell 96GB 조건
FastMTP 대 MTP 비활성화, 추론generation throughput최대 1.93x (+93.3%)README의 동일 변형 공개 측정치이며, Q8_K_P·depth 3·RTX PRO 6000 Blackwell 96GB 조건
FastMTP 대 standard embedded MTP, 문서generation throughput+35.2%README의 동일 변형 공개 측정치이며, Q8_K_P에서 FastMTP depth 3과 standard embedded MTP depth 2를 비교한 값
Q3_K_P FastMTP 전체 윈도우prompt processing / generation throughput1613.81 PP tok/s / 131.81 TG tok/s, draft acceptance 92.0%README의 동일 변형 공개 측정치이며, 190,000 uncached prompt tokens와 64 generated tokens, 204800 설정 컨텍스트 조건

195

Likes

27.7k

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.