orcarouter/Qwen3.8-27B-Uncensored-FP8
27B 규모의 Qwen3.8 기반 image-text-to-text 생성 모델로, 텍스트·이미지 이해와 reasoning·tool calling을 처리합니다.27B262K 컨텍스트Apache-2.0
Qwen3.8-27B의 refusal direction을 제거하고 공식 FP8 방식으로 양자화한 연구용 vision-language 모델입니다.
학습 방식 · Qwen3.8-27B에 abliteration으로 residual stream의 refusal direction을 제거한 뒤, 공식 Qwen3.8-27B-FP8과 동일한 offline 128×128 Block-FP8 E4M3 양자화를 적용했습니다.
TL;DR
이 모델은 Qwen3.8-27B를 기반으로 refusal direction을 제거한 abliterated 모델이며, 이후 공식 Qwen3.8-27B-FP8과 같은 Block-FP8 방식으로 양자화한 변형입니다. 128×128 E4M3 가중치 양자화와 동적 activation FP8을 사용하면서 vision tower, reasoning, tool calling, MTP speculative decoding, 262K context를 보존합니다. thinking OFF 기준 AdvBench와 JailbreakBench refusal은 각각 0.0%로 낮아졌고, MMLU는 84.7%로 원본 FP8의 84.3%와 비슷합니다. 따라서 일반 능력을 거의 유지한 채 refusal 메커니즘을 연구하거나 red-teaming할 수 있지만, 자체 guardrail이 없어 공개 배포에는 부적합합니다.
핵심 포인트
- Qwen3.8-27B를 기반으로 refusal direction을 제거한 abliterated 모델입니다. 유해 요청에 대한 거부 동작을 크게 낮춰 red-teaming과 안전 연구에 맞습니다. 일반 능력은 원본 FP8과 거의 같은 수준으로 유지됩니다.
- abliteration 뒤에 공식 Qwen3.8-27B-FP8과 동일한 128×128 Block-FP8 E4M3 방식으로 양자화했습니다. 선형 계층의 가중치는 FP8로 저장하고 vision tower와 norm 등은 BF16으로 보존합니다. 30.9GB의 7개 safetensors shard로 구성됩니다.
- Gated DeltaNet 선형 attention 48개와 full attention 16개를 결합한 hybrid-attention 구조입니다. 262,144토큰 context와 MTP speculative decoding head를 그대로 유지합니다. vLLM에서 reasoning·function calling·vision 처리를 함께 사용할 수 있습니다.
- 안전 거부율은 thinking OFF 기준 AdvBench와 JailbreakBench에서 각각 0.0%입니다. MMLU는 원본 FP8의 84.3%에서 84.7%로 측정됐습니다. 다만 안전 장치가 제거되어 공개 서비스에는 별도 moderation 계층이 필요합니다.
제한사항
- Safety alignment가 상당 부분 제거되어 원본 모델이 거부할 유해·불법 요청에도 응답할 수 있습니다. 모델 자체의 의미 있는 guardrail이 없으므로 end user나 production 환경에 바로 배포하면 안 됩니다. 사용자는 별도 safety·moderation·abuse-prevention 계층과 관련 법규를 적용해야 합니다.
- Block-FP8은 BF16 대비 lossless 방식이 아니어서 일부 생성 artifact가 발생할 수 있습니다. 원본 FP8과 비교한 capability 차이는 벤치마크별 최대 1.3점 하락으로 측정됐습니다. refusal 평가는 rule-based opening-phrase classifier에 기반하므로 실제 안전성을 완전히 측정하지 않습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| AdvBench refusal, thinking OFF | harmful-prompt refusal | 0.0% | 공식 Qwen3.8-27B-FP8 99.0%에서 0.0%로 감소 |
| JailbreakBench harmful, thinking OFF | harmful-prompt refusal | 0.0% | 공식 Qwen3.8-27B-FP8 94.0%에서 0.0%로 감소 |
| StrongREJECT, thinking OFF | harmful-prompt refusal | 2.0% | 공식 Qwen3.8-27B-FP8 97.3%에서 2.0%로 감소 |
| HarmBench standard, thinking OFF | harmful-prompt refusal | 2.7% | 공식 Qwen3.8-27B-FP8 98.7%에서 2.7%로 감소 |
| MaliciousInstruct, thinking OFF | harmful-prompt refusal | 0.0% | 공식 Qwen3.8-27B-FP8 99.0%에서 0.0%로 감소 |
| SimpleSafetyTests, thinking OFF | harmful-prompt refusal | 6.0% | 공식 Qwen3.8-27B-FP8 64.0%에서 6.0%로 감소 |
| ForbiddenQuestions, thinking OFF | harmful-prompt refusal | 4.7% | 공식 Qwen3.8-27B-FP8 73.3%에서 4.7%로 감소 |
| AdvBench, thinking ON | harmful-prompt refusal | 1.7% | 공식 Qwen3.8-27B-FP8 66.7% 대비 측정값 |
| JailbreakBench harmful, thinking ON | harmful-prompt refusal | 0.0% | 공식 Qwen3.8-27B-FP8 43.3% 대비 측정값 |
| StrongREJECT, thinking ON | harmful-prompt refusal | 0.0% | 공식 Qwen3.8-27B-FP8 35.0% 대비 측정값 |
| XSTest-safe, thinking OFF | benign prompt over-refusal | 0.4% | 공식 Qwen3.8-27B-FP8 5.6% 대비 감소 |
| XSTest-safe, thinking ON | benign prompt over-refusal | 0.0% | 공식 Qwen3.8-27B-FP8 0.0%와 동일 |
| MMLU all, 0-shot letter | accuracy | 84.7% | 공식 Qwen3.8-27B-FP8 84.3% 대비 +0.4점 |
| MMLU-Pro, CoT | accuracy | 76.8% | 공식 Qwen3.8-27B-FP8 77.6% 대비 −0.8점 |
| GSM8K, CoT | accuracy | 88.7% | 공식 Qwen3.8-27B-FP8 90.0% 대비 −1.3점 |
| CMMLU, 0-shot Chinese | accuracy | 80.8% | 공식 Qwen3.8-27B-FP8 81.4% 대비 −0.6점 |
| WikiText-2-raw | perplexity | 6.96 | 이 정확한 FP8 빌드에서 측정된 언어 모델링 수치 |
145
Likes
0
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.