본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

orcarouter/Qwen3.8-27B-Uncensored-GGUF

이미지·텍스트 입력을 처리하는 추론·도구 호출·Reasoning용 Vision-Language 모델27Bapache-2.0

Qwen3.8-27B의 refusal direction을 제거하고 2~16비트 GGUF로 양자화한 Vision-Language 연구용 모델

학습 방식 · Qwen3.8-27B를 GGUF로 양자화하고 residual stream의 refusal direction을 직교화하는 abliteration을 적용한 뒤, K-quants와 importance matrix 기반 IQ quants로 배포한 변형입니다.

TL;DR

Qwen3.8-27B를 기반으로 refusal direction을 제거한 abliterated 양자화 모델이며, 원본의 안전 거부보다 연구용 무검열 응답에 초점을 맞췄습니다. Gated DeltaNet linear attention과 full attention을 결합한 hybrid 구조에 Reasoning, tool calling, MTP nextn head, Vision 기능을 유지했습니다. GGUF 파일은 2비트부터 16비트까지 제공되고 Q4_K_M은 16.8GB이며, 이미지 입력에는 별도 0.9GB mmproj가 필요합니다. 동일 abliterated 빌드의 평가에서 유해 요청 거부율은 0~6%로 낮아졌고 MMLU 84.7%, GSM8K 88.7%로 기반 FP8 대비 성능 차이는 -1.3점 이내였습니다. 최신 llama.cpp 또는 mmproj가 포함된 Ollama 환경에서 AI-safety 연구와 red-teaming에 적합하지만 자체 안전 계층 없이는 배포하기 어렵습니다.

핵심 포인트

  • 이 모델은 Qwen3.8-27B를 기반으로 refusal direction을 residual stream에서 직교화한 abliterated 변형입니다. 원본 모델의 안전 정렬을 크게 제거해 유해 요청에도 응답하도록 설계됐습니다. AI-safety 연구와 red-teaming을 위한 모델이며 일반 서비스 배포에는 별도 안전 계층이 필요합니다.
  • GGUF 형식으로 2비트부터 16비트까지 제공되어 llama.cpp에서 CPU, CUDA, Metal, ROCm으로 실행할 수 있습니다. Q4_K_M은 16.8GB로 품질과 크기의 균형을 맞춘 기본 선택지입니다. 저비트 IQ 계열은 English·Chinese calibration text로 만든 importance matrix를 사용해 비트당 품질을 보완합니다.
  • Qwen3.8의 Gated DeltaNet linear attention과 full attention을 결합한 hybrid-attention 구조를 유지합니다. 내장된 MTP nextn head는 llama.cpp의 speculative decoding 경로에서 선택적으로 사용할 수 있습니다. Reasoning, multi-turn tool calling, image·OCR 처리가 GGUF 빌드에서 작동하도록 구성됐습니다.
  • 이미지 입력에는 약 0.9GB의 별도 mmproj 파일이 필요합니다. llama-server에서는 --mmproj와 --jinja를 함께 사용해 Vision과 OpenAI 호환 tool calling을 활성화합니다. Ollama 배포판은 mmproj를 번들로 포함해 별도 projector 파일 없이 같은 기능을 제공합니다.

제한사항

  • 안전 정렬을 크게 제거했기 때문에 원본 Qwen3.8-27B가 거부할 유해·비윤리·불법 요청에도 응답할 수 있습니다. README는 해석 가능성 연구, AI-safety 연구, red-teaming, robustness evaluation 같은 합법적 연구 용도를 명시합니다. 실제 배포에는 자체 moderation과 안전 계층이 필요합니다.
  • qwen35 hybrid-GDN 구조와 MTP·nextn speculative head를 포함한 최신 llama.cpp가 필요합니다. README는 필요한 변경 사항이 2026년 5월에 병합됐으며 구버전에서는 파일이 로드되지 않는다고 명시합니다. 실행 전 llama.cpp 버전을 확인해야 합니다.
  • Q2_K와 Q3 계열은 파일 크기가 작지만 낮은 비트에서 품질 저하가 커질 수 있습니다. README는 특히 Q2_K와 Q3에서 추가 성능 저하가 두드러질 수 있다고 안내합니다. Q4_K_M은 16.8GB, IQ4_XS는 약 4.25비트와 15.3GB이며 이미지 입력에는 약 0.9GB mmproj가 더 필요합니다.

벤치마크

벤치마크지표비교
AdvBench · thinking OFFharmful-prompt refusal0.0%Qwen/Qwen3.8-27B-FP8 기반 모델의 공개 비교 수치 99.0%; 이 GGUF 자체가 아닌 동일 abliterated 빌드의 평가
JailbreakBench (harmful) · thinking OFFharmful-prompt refusal0.0%기반 Qwen3.8-27B-FP8 94.0%; 이 양자화 버전 자체가 아닌 동일 abliterated 빌드의 평가
StrongREJECT · thinking OFFharmful-prompt refusal2.0%기반 Qwen3.8-27B-FP8 97.3%; 이 양자화 버전 자체가 아닌 동일 abliterated 빌드의 평가
HarmBench (standard) · thinking OFFharmful-prompt refusal2.7%기반 Qwen3.8-27B-FP8 98.7%; 이 양자화 버전 자체가 아닌 동일 abliterated 빌드의 평가
XSTest-safe · thinking OFFbenign over-refusal0.4%기반 Qwen3.8-27B-FP8 5.6%; 이 양자화 버전 자체가 아닌 동일 abliterated 빌드의 평가
MMLU (all, 0-shot)accuracy84.7%기반 Qwen3.8-27B-FP8 84.3%, +0.4점; 이 양자화 버전 자체가 아닌 동일 abliterated 빌드의 평가
MMLU-Pro (CoT)accuracy76.8%기반 Qwen3.8-27B-FP8 77.6%, -0.8점; 이 양자화 버전 자체가 아닌 동일 abliterated 빌드의 평가
GSM8K (CoT)accuracy88.7%기반 Qwen3.8-27B-FP8 90.0%, -1.3점; 이 양자화 버전 자체가 아닌 동일 abliterated 빌드의 평가
CMMLU (0-shot, Chinese)accuracy80.8%기반 Qwen3.8-27B-FP8 81.4%, -0.6점; 이 양자화 버전 자체가 아닌 동일 abliterated 빌드의 평가
WikiText-2perplexity6.96기반 모델 비교 수치 없음; 동일 abliterated 빌드의 fluency sanity check

114

Likes

15k

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.