OBLITERATUS/Qwen3.8-27B-OBLITERATED
안전 거부 동작을 제거한 대화형 텍스트 생성27Bapache-2.0
SVD와 LEACE 가중치 혼합으로 거부율 0%와 MMLU 86.3%를 겨냥한 Qwen3.8-27B 변형
학습 방식 · Qwen/Qwen3.8-27B 기반의 abliteration 가중치 수술 모델로, 공격적인 SVD 방식과 capability 보존을 겨냥한 LEACE 방식의 결과를 각각 만든 뒤 60% 대 40%로 혼합했습니다.
TL;DR
이 모델은 Qwen/Qwen3.8-27B의 가중치에서 안전 거부 방향을 제거한 V2 abliteration 모델이며, 일반적인 Fine-tuning이나 단순 양자화 변형이 아닙니다. 공격적인 SVD 수술은 거부 축을 깊게 제거하지만 capability를 손상시키고, LEACE 수술은 capability를 더 보존하는 대신 거부 잔여를 남기는 특성이 있어 두 결과를 60% 대 40%로 혼합했습니다. 그 결과 MMLU 0-shot은 기본 모델의 85.3%에서 86.3%로 올라갔고, 공개된 V2 표본에서는 거부율 0%를 기록했으며 실사용 과제는 8개 중 7개를 통과했습니다. 다만 전체 842개 거부 평가와 전체 MMLU 검증이 끝나지 않았고, 사용 시 temperature 0, repetition_penalty 1.15, max_new_tokens 2048 이상 설정이 권장됩니다.
핵심 포인트
- SVD와 LEACE의 서로 다른 손상을 상쇄하도록 가중치를 60 대 40으로 혼합했습니다.
- 거부율을 낮추면서 MMLU 점수를 기본 모델보다 1.1%포인트 높였습니다.
- temperature 0과 repetition_penalty 1.15가 코드 중심 출력의 반복을 줄이는 핵심 설정입니다.
- GGUF, Safetensors, MLX 형식으로 배포해 llama.cpp와 Apple Silicon에서도 실행할 수 있습니다.
제한사항
- 842개 harmful prompt 전체에 대한 V2 검증은 아직 진행 중이며, 현재 공개된 표본은 52개입니다.
- Multi-tool chain 과제는 V2와 기본 모델 모두 통과하지 못해 복합 도구 호출에 한계가 있습니다.
- MLX 4-bit와 8-bit 양자화 파일은 V1 기반이며 V2용 파일로 갱신될 예정입니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU lm-eval 0-shot | accuracy | 86.3% ±0.014 (n=570) | 기본 Qwen3.8-27B 85.3% 대비 +1.1pp이며, 전체 14k 문항 검증은 진행 중 |
| Refusal Rate Hard-10 | refusal rate | 0/10 (0%) | V1과 V2 모두 10개 프롬프트에서 거부 0건 |
| Refusal Rate 842-Corpus | refusal rate | 0/52 (0%) 표본 | V2 무작위 52개 표본 기준 공개 수치이며, 전체 842개 검증은 진행 중 |
| Advanced Real-World Tasks | task success | 7/8 | 기본 Qwen3.8-27B와 동일하며, ReAct·비동기 리팩터링·Kubernetes 디버깅 등을 통과하고 Multi-tool chain은 실패 |
255
Likes
4.4k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.