0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF
Qwen3.8-27B를 기반으로 거부 응답을 줄인 텍스트 생성용 GGUF 양자화 모델입니다.27B262K 컨텍스트Apache-2.0
Qwen3.8-27B에 3회 ARA를 적용한 거부 완화형 GGUF 모델
학습 방식 · Qwen3.8-27B 기반 ARA(Arbitrary-Rank Ablation) 변형으로, trohrbaugh/Qwen3.8-27B-heretic-ara에 두 차례 full-weight ARA refinement를 추가한 뒤 GGUF로 양자화했습니다.
TL;DR
이 모델은 Qwen3.8-27B를 기반으로 ARA를 총 세 차례 적용한 거부 완화형 GGUF 양자화 모델입니다. ARA는 Attention과 MLP의 가중치 행렬을 LBFGS로 직접 최적화해 무해 프롬프트의 출력은 보존하고 유해 프롬프트의 거부 동작은 줄입니다. 독립 평가에서 거부 수는 원본 heretic-ara의 3/100에서 0–1/100으로 줄었고, KL은 0.0085로 측정됐습니다. F16·BF16부터 1비트 imatrix까지 제공하므로 VRAM과 컨텍스트 길이에 맞춰 파일을 선택할 수 있지만, 안전 가드레일이 감소해 별도 필터링이 필요한 배포에는 부적합합니다.
핵심 포인트
- Qwen3.8-27B에 ARA를 총 세 차례 적용해 거부 회로를 조정한 변형 모델입니다. 전체 가중치 행렬을 직접 최적화해 단일 방향 제거보다 넓은 거부 제거 영역을 다룹니다. 원래 모델의 일반적인 동작 변화는 KL 0.0085로 낮게 유지했습니다.
- ARA는 무해 프롬프트의 출력을 보존하면서 유해 프롬프트 출력을 무해 데이터 분포 쪽으로 이동시킵니다. LBFGS로 Attention out-projection과 MLP down-projection의 가중치 행렬을 최적화합니다. k-nearest-neighbor 거리와 overcorrect 항을 함께 사용해 잔여 거부를 줄입니다.
- GGUF 파일을 F16부터 1비트 imatrix 양자화까지 폭넓게 제공합니다. RVN-Q4_K_M은 16.55GB로 24GB VRAM 환경에 권장됩니다. 긴 컨텍스트에서는 모델 파일보다 KV cache에 필요한 메모리를 먼저 확보해야 합니다.
제한사항
- 안전 가드레일을 의도적으로 줄였으므로 강력한 안전 필터링이나 콘텐츠 moderation이 필요한 서비스에는 적합하지 않습니다. 미성년자 대상 배포도 권장되지 않습니다. 모델 출력에 의존하기보다 별도 안전 정책과 필터를 구성해야 합니다.
- 일부 강한 안전 학습 범주는 남아 있어 모든 유해 프롬프트에 동일하게 응답하지 않습니다. 독립 평가에서도 화학무기 관련 프롬프트는 남은 거부 사례로 확인됐습니다. 도메인과 언어에 따라 거부 동작이 달라질 수 있습니다.
- GGUF 양자화 수준에 따라 품질과 VRAM 요구량이 달라집니다. RVN-IQ3_M의 이전 파일은 NaN·Inf 스케일과 0으로 채워진 텐서가 포함돼 제거됐으며, 재양자화 파일이 다시 업로드됐습니다. 새 파일인지 확인하지 않으면 모든 백엔드에서 슬래시만 생성하던 손상 버전을 받을 수 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| 유해 행동 프롬프트 100개 거부 평가 | 거부 수 | 0–1/100 | 기반 모델 Qwen3.8-27B는 약 99/100, 원본 heretic-ara는 3/100 |
| 기반 모델 대비 행동 보존 | KL divergence | 0.0085 | 원본 heretic-ara의 공개 수치 0.0535보다 낮은 RVN 측정치 |
| RVN-IQ3_M 생성 검증 | 처리량 | 70+ tokens/s | F16에서 재양자화 후 "The capital of France is"에 Paris를 생성한 검증 수치 |
105
Likes
106.1k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.