orcarouter/Qwen3.8-27B-Uncensored-MLX
Apple Silicon에서 실행하는 멀티모달 텍스트·이미지 생성과 reasoning, function-calling27B262K 컨텍스트apache-2.0
Qwen3.8-27B의 거부 방향을 제거하고 Apple Silicon용 2·4·6·8-bit MLX로 변환한 멀티모달 모델
학습 방식 · Qwen/Qwen3.8-27B에 abliteration으로 refusal direction을 제거한 뒤 MLX affine quantization을 적용했으며, 별도의 특화 데이터 학습 정보는 없습니다.
TL;DR
이 모델은 Qwen/Qwen3.8-27B를 기반으로 refusal direction을 제거한 abliteration 변형이며, MLX affine quantization으로 Apple Silicon용 2·4·6·8-bit 배포본을 제공합니다. 27B dense 모델은 Gated DeltaNet linear attention 48개와 full attention 16개를 결합하고 native vision-language tower, thinking control, tool-calling을 유지합니다. vision tower와 norms, conv layers는 BF16으로 보존하고 언어 모델의 linear weights만 양자화해 4-bit 이상에서 이미지·텍스트·코드 생성과 0회 거부 probe를 유지합니다. 4-bit는 약 15GB와 24GB RAM을 요구하는 기본 선택지이며, 2-bit는 cosine 0.92와 심각한 생성 품질 저하 때문에 실제 작업에 권장되지 않습니다.
핵심 포인트
- Qwen/Qwen3.8-27B의 거부 방향을 제거해 안전 응답 없이 red-teaming을 수행하는 연구용 변형입니다.
- MLX affine quantization과 group size 64를 적용해 Apple Silicon에서 2·4·6·8-bit로 실행합니다.
- vision tower와 BF16 계층을 보존해 이미지의 형태·색상·위치·배경·텍스트 처리를 유지합니다.
- 4·6·8-bit는 품질을 유지하지만 2-bit는 반복과 깨진 출력을 일으켜 실제 사용에 부적합합니다.
제한사항
- abliteration으로 기본 안전 정렬과 거부 기능을 크게 제거해 유해하거나 불법적인 요청에도 응답합니다. 따라서 jailbreak와 safety probe에서 거부하지 않는 결과는 안전 성능을 뜻하지 않습니다. 실제 배포에는 별도의 moderation과 abuse-prevention 계층이 필요합니다.
- 2-bit 양자화는 27B 모델의 생성 품질을 크게 떨어뜨려 반복 루프와 깨진 출력이 발생합니다. README 측정에서 수치 충실도 cosine이 0.92로 4·6·8-bit보다 낮습니다. 2-bit는 보관용으로만 권장됩니다.
- 262,144 tokens의 긴 context와 vision, tool-calling이 유지되지만 공격 표면도 함께 넓어집니다. 이미지 이해와 agentic 사용에서도 안전장치 없는 출력 위험이 이어집니다. end user나 production 환경에서 자체 안전 계층 없이 사용하는 범위는 제외됩니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| 8-bit 수치 충실도 | cosine | 0.9997 | abliterated BF16 원본과 비교한 README 측정치 |
| 6-bit 수치 충실도 | cosine | 0.9996 | abliterated BF16 원본과 비교한 README 측정치 |
| 4-bit 수치 충실도 | cosine | 0.996 | abliterated BF16 원본과 비교한 README 측정치 |
| 2-bit 수치 충실도 | cosine | 0.92 | abliterated BF16 원본과 비교한 README 측정치 |
| 4·6·8-bit 텍스트·중국어·코드 | generation test | 통과 | README의 GPU 생성 테스트 결과 |
| 4·6·8-bit refusal probe | refusals | 0회 거부 | exploit walkthrough와 controversial argument red-team probe 측정치 |
| 4·6·8-bit vision | probe image understanding | 유지 | 형태·색상·위치·배경·텍스트 처리를 확인한 README 테스트 |
| MLX CUDA backend | steady-state speed | 약 32–37 tok/s | 단일 H200에서 측정한 README 공개 수치 |
243
Likes
0
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.