본문으로 건너뛰기

Qwen3.8-27B Uncensored Aggressive GGUF와 FastMTP 공개

Qwen3.8-27B Uncensored 변형이 FastMTP로 document TG 최대 3.02배를 기록했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

HauhauCS가 Qwen3.8-27B 기반 Uncensored Aggressive 모델을 전체 K_P quant와 Vision, native NextN, FastMTP sidecar 구성으로 공개했습니다. Q8_K_P 테스트에서 MTP 비활성화 대비 document TG 최대 3.02배, reasoning TG 최대 1.93배를 기록했으며, standard embedded MTP보다도 각각 최대 35.2%, 21.1% 높은 수치를 냈습니다. 각 초안 토큰은 전체 target 모델의 검증을 거친 뒤 채택되고, 903 MB sidecar 하나가 모든 text quant에 공유됩니다. 모델은 262,144 context와 text·image·video 입력을 지원하며, 작성자는 checksums와 signed provenance 확인을 당부했습니다.

실용적 조언

  • FastMTP 성능을 비교할 때는 hardware, quant, context, draft depth를 함께 기록해야 게시글의 document TG와 reasoning TG 수치와 조건을 맞출 수 있습니다.
  • thinking mode와 non-thinking mode의 sampling params가 다르므로 enable_thinking 설정과 temp, top_k, top_p 값을 분리해 적용해야 합니다.
  • llama.cpp에서 native embedded NextN을 사용하려면 --jinja를 적용하고, 최적화된 FastMTP 경로에서는 저장소에 포함된 sidecar와 llama.cpp patch를 함께 사용해야 합니다.
  • Hugging Face에서 K_P 파일이 전체 목록에 보이지 않으면 View variants 또는 Files and versions를 확인하고, LM Studio의 ? 표시는 양자화 열의 외형적 표시일 뿐이라는 점을 감안해야 합니다.
  • Uncensored 또는 HauhauCS Aggressive라는 이름을 단 GGUF에 악성 payload가 포함될 수 있다는 작성자의 경고가 있으므로, 배포 저장소의 checksums와 signed provenance를 확인한 뒤 파일을 사용해야 합니다.

섹션별 상세

작성자는 Qwen3.8-27B 기반의 Uncensored Aggressive 변형을 공개했으며, 어려운 프롬프트에서 거부와 불필요한 서문을 줄이는 프로파일을 적용했다고 밝혔습니다. 모델은 reasoning, agentic, image, video 기능을 유지하고, 465개 테스트 프롬프트에서 거부 0건을 기록했다고 게시글에 적었습니다. 이 수치는 작성자의 최종 점검 결과이며 독립적인 커뮤니티 검증 결과로 제시되지는 않았습니다.
가장 큰 기술적 추가 사항은 903 MB sidecar를 사용하는 HauhauCS FastMTP 경로입니다. Q8_K_P 서비스 테스트에서 MTP를 끈 경우와 비교해 document TG가 최대 3.02배, reasoning TG가 최대 1.93배에 도달했고, standard embedded MTP profile보다 각각 최대 35.2%, 21.1% 높은 처리량을 기록했습니다. 각 초안 토큰은 전체 target 모델이 검증한 뒤 채택되므로 초안 생성 속도만으로 결과를 확정하지 않는 구조이며, 비교 수치는 quant, context, draft depth, hardware에 따라 달라질 수 있습니다.
배포물은 Q8_K_P부터 Q2_K_P와 IQ 계열까지 전체 K_P quant 범위를 포함하고, 모든 text quant가 같은 FastMTP sidecar를 공유합니다. image와 video 입력에는 BF16 mmproj가 사용되며, text GGUF에는 Qwen3.8의 native embedded NextN head가 보존됩니다. 최적화 경로는 sidecar와 llama.cpp patch를 함께 사용하고, README에 build 및 serving 명령을 제공하는 방식입니다.
모델 사양은 27B dense, 64 layers, 262,144 native context이며 48개 Gated DeltaNet layers와 16개 gated-attention layers로 구성됩니다. thinking mode에는 temp=1.0, top_k=20, top_p=0.95가, non-thinking mode에는 temp=0.7, top_k=20, top_p=0.80과 enable_thinking=false가 권장됩니다. llama.cpp에서는 --jinja를 사용해야 하며, LM Studio에서 K_P가 ?로 표시되거나 Hugging Face 하드웨어 위젯에서 파일이 숨겨지는 현상은 로딩 가능성과 무관한 표시 문제로 안내됩니다.

용어 해설

GGUF
LLM 가중치와 실행에 필요한 메타데이터를 하나의 파일에 담는 모델 파일 형식입니다. 이 글에서는 다양한 양자화 버전이 llama.cpp와 LM Studio 같은 GGUF 런타임에서 동작하도록 배포됩니다.
다음 토큰 다중 예측(MTP)
모델이 다음 토큰을 여러 개 초안으로 예측한 뒤 전체 대상 모델이 이를 검증하는 추론 방식입니다. 초안 토큰이 검증을 통과하면 생성 과정에 채택되어 토큰 처리량을 높입니다.
NextN 헤드(NextN)
한 번에 여러 미래 토큰을 예측하는 모델 내부 구성 요소입니다. 이 모델의 text GGUF에는 NextN 헤드가 내장되어 있어 최신 upstream llama.cpp에서 별도 구성 없이 embedded MTP를 사용할 수 있습니다.
K_P 양자화(K_P quants)
모델별로 최적화 프로파일을 따로 적용한 사용자 정의 양자화 계열입니다. 기본 양자화보다 파일 크기가 약 5~15% 늘어나는 대신 품질이 한두 단계 높아지도록 설계됐으며 일반 GGUF 런타임에서 로드됩니다.
Gated DeltaNet 레이어(Gated DeltaNet)
이 모델의 64개 레이어 중 48개를 구성하는 레이어 유형입니다. 나머지 16개는 gated-attention 레이어로 구성되며, 글에서는 이 혼합 구조를 27B dense 모델의 사양으로 제시합니다.

언급된 도구

llama.cpp추천

GGUF 모델을 실행하고 native embedded NextN 또는 HauhauCS FastMTP 경로를 서빙하는 런타임

LM Studio중립

GGUF 모델을 로드해 사용하는 런타임

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 18.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.