TL;DR
HauhauCS가 Qwen3.8-27B 기반 Uncensored Aggressive 모델을 전체 K_P quant와 Vision, native NextN, FastMTP sidecar 구성으로 공개했습니다. Q8_K_P 테스트에서 MTP 비활성화 대비 document TG 최대 3.02배, reasoning TG 최대 1.93배를 기록했으며, standard embedded MTP보다도 각각 최대 35.2%, 21.1% 높은 수치를 냈습니다. 각 초안 토큰은 전체 target 모델의 검증을 거친 뒤 채택되고, 903 MB sidecar 하나가 모든 text quant에 공유됩니다. 모델은 262,144 context와 text·image·video 입력을 지원하며, 작성자는 checksums와 signed provenance 확인을 당부했습니다.
실용적 조언
- FastMTP 성능을 비교할 때는 hardware, quant, context, draft depth를 함께 기록해야 게시글의 document TG와 reasoning TG 수치와 조건을 맞출 수 있습니다.
- thinking mode와 non-thinking mode의 sampling params가 다르므로 enable_thinking 설정과 temp, top_k, top_p 값을 분리해 적용해야 합니다.
- llama.cpp에서 native embedded NextN을 사용하려면 --jinja를 적용하고, 최적화된 FastMTP 경로에서는 저장소에 포함된 sidecar와 llama.cpp patch를 함께 사용해야 합니다.
- Hugging Face에서 K_P 파일이 전체 목록에 보이지 않으면 View variants 또는 Files and versions를 확인하고, LM Studio의 ? 표시는 양자화 열의 외형적 표시일 뿐이라는 점을 감안해야 합니다.
- Uncensored 또는 HauhauCS Aggressive라는 이름을 단 GGUF에 악성 payload가 포함될 수 있다는 작성자의 경고가 있으므로, 배포 저장소의 checksums와 signed provenance를 확인한 뒤 파일을 사용해야 합니다.
섹션별 상세
용어 해설
- GGUF
- — LLM 가중치와 실행에 필요한 메타데이터를 하나의 파일에 담는 모델 파일 형식입니다. 이 글에서는 다양한 양자화 버전이 llama.cpp와 LM Studio 같은 GGUF 런타임에서 동작하도록 배포됩니다.
- 다음 토큰 다중 예측(MTP)
- — 모델이 다음 토큰을 여러 개 초안으로 예측한 뒤 전체 대상 모델이 이를 검증하는 추론 방식입니다. 초안 토큰이 검증을 통과하면 생성 과정에 채택되어 토큰 처리량을 높입니다.
- NextN 헤드(NextN)
- — 한 번에 여러 미래 토큰을 예측하는 모델 내부 구성 요소입니다. 이 모델의 text GGUF에는 NextN 헤드가 내장되어 있어 최신 upstream llama.cpp에서 별도 구성 없이 embedded MTP를 사용할 수 있습니다.
- K_P 양자화(K_P quants)
- — 모델별로 최적화 프로파일을 따로 적용한 사용자 정의 양자화 계열입니다. 기본 양자화보다 파일 크기가 약 5~15% 늘어나는 대신 품질이 한두 단계 높아지도록 설계됐으며 일반 GGUF 런타임에서 로드됩니다.
- Gated DeltaNet 레이어(Gated DeltaNet)
- — 이 모델의 64개 레이어 중 48개를 구성하는 레이어 유형입니다. 나머지 16개는 gated-attention 레이어로 구성되며, 글에서는 이 혼합 구조를 27B dense 모델의 사양으로 제시합니다.
언급된 도구
GGUF 모델을 실행하고 native embedded NextN 또는 HauhauCS FastMTP 경로를 서빙하는 런타임
GGUF 모델을 로드해 사용하는 런타임
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.