orcarouter/Qwen3.8-27B-Uncensored
이미지와 텍스트를 함께 처리하는 Vision-Language 생성, reasoning, tool calling27B262K 컨텍스트apache-2.0
Qwen3.8-27B의 거부 방향을 제거하고 Vision-Language·MTP·BF16 구조를 유지한 연구용 모델
학습 방식 · Qwen/Qwen3.8-27B 기반 BF16 가중치에 abliteration을 적용해 refusal direction을 제거한 post-training 변형입니다. 원본 full-precision 구조를 유지하므로 SFT·DPO·RL·LoRA·QLoRA와 재양자화를 위한 기반으로 사용할 수 있습니다.
TL;DR
이 모델은 Qwen/Qwen3.8-27B를 기반으로 refusal direction을 가중치에서 제거한 BF16 abliterated Fine-tune입니다. layer 38에서 추정한 단일 거부 방향을 131개 residual-writing matrix에 직교 제거하면서 vision tower와 MTP head, 262,144토큰 컨텍스트를 유지합니다. thinking·tool calling·vision/OCR을 지원하고, AdvBench 거부율은 thinking OFF 기준 0.0%로 공개됐습니다. MMLU 84.7%로 기반 모델 84.3%와 비슷하지만, 안전 장치가 거의 없어 연구·red-teaming 외 배포에는 자체 moderation 계층이 필요합니다.
핵심 포인트
- Qwen/Qwen3.8-27B를 기반으로 거부 방향을 제거한 abliterated Fine-tune입니다. 유해 요청에 대한 기본 거부 행동을 크게 낮췄습니다. 안전 연구와 red-teaming을 위한 모델입니다.
- BF16 원본 가중치 55.6GB를 safetensors 18개 shard로 제공합니다. 262,144토큰 컨텍스트와 Gated DeltaNet·full attention 혼합 구조를 유지합니다. 전체 vision tower와 MTP head도 보존됩니다.
- abliteration은 layer 38에서 추정한 refusal direction을 131개 residual-writing matrix에서 직교 제거합니다. vision tower는 수정하지 않고 MTP head에는 같은 편집을 적용합니다. 약 56GB VRAM과 H100 80GB급 환경이 필요합니다.
제한사항
- 안전 정렬과 거부 장치가 상당 부분 제거되어 유해하거나 불법적인 요청에도 응답할 수 있습니다. 공개 서비스나 최종 사용자 배포에는 별도의 moderation·abuse prevention 계층이 필요합니다. README는 통제된 연구·red-teaming 용도로 사용 범위를 제한합니다.
- abliteration은 데이터 수준의 unlearning이 아니라 가중치 편집입니다. 거부 중심 SFT나 safety-aligned 데이터로 추가 학습하면 거부 행동이 일부 다시 나타날 수 있습니다. 모델은 Qwen/Qwen3.8-27B의 편향과 한계도 이어받습니다.
- 거부율 수치는 rule-based opening-phrase classifier로 산출되어 publication-grade LLM judge 결과가 아닙니다. BF16 가중치만 약 56GB이므로 KV cache를 포함하면 단일 H100 80GB 또는 H200 환경이 권장됩니다. 더 작은 장치에서는 FP8이나 GGUF 파생 릴리스가 필요합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| AdvBench | harmful-prompt refusal, thinking OFF | 0.0% | 공식 Qwen/Qwen3.8-27B 기반 모델 99.0%와 비교한 README 공개 수치이며, 이 모델 측정값입니다. |
| JailbreakBench (harmful) | harmful-prompt refusal, thinking OFF | 0.0% | 공식 기반 모델 94.0%와 비교한 README 공개 수치이며, 이 모델 측정값입니다. |
| StrongREJECT | harmful-prompt refusal, thinking OFF | 2.0% | 공식 기반 모델 97.3%와 비교한 README 공개 수치이며, 이 모델 측정값입니다. |
| HarmBench (standard) | harmful-prompt refusal, thinking OFF | 2.7% | 공식 기반 모델 98.7%와 비교한 README 공개 수치이며, 이 모델 측정값입니다. |
| MMLU | accuracy, 0-shot letter | 84.7% | 공식 기반 모델 84.3% 대비 +0.4점인 README 공개 수치이며, 양자화 버전이 아닌 동일 abliterated checkpoint 평가를 가리키는 수치는 아닙니다. |
| GSM8K | accuracy, CoT | 88.7% | 공식 기반 모델 90.0% 대비 -1.3점인 README 공개 수치이며, 양자화 버전이 아닌 동일 abliterated checkpoint 평가를 가리키는 수치는 아닙니다. |
| CMMLU | accuracy, 0-shot Chinese | 80.8% | 공식 기반 모델 81.4% 대비 -0.6점인 README 공개 수치이며, 양자화 버전이 아닌 동일 abliterated checkpoint 평가를 가리키는 수치는 아닙니다. |
| WikiText-2-raw | perplexity, BF16 KV | 6.96 | README에서 언어 모델링 품질 확인용으로 공개한 이 모델 측정값이며, 공식 기반 모델 비교값은 제공되지 않았습니다. |
100
LIKES
8.7k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.