orcarouter/GLM-5.3-Flash-Uncensored-FP8
텍스트 생성, 대화, reasoning, function calling, image-text-to-text~320B total / ~18B active1K 컨텍스트MIT
GLM-5.3-Flash의 거부 방향을 FP8 가중치에서 제거한 연구용 모델
학습 방식 · zai-org/GLM-5.3-Flash 기반으로 residual stream의 refusal direction을 abliteration 방식으로 제거하고 공식 block-FP8 shard에 직접 반영한 가중치 편집
TL;DR
이 모델은 zai-org/GLM-5.3-Flash를 기반으로 안전 정렬의 거부 방향을 제거한 abliteration 계열 Fine-tune 가중치 편집본이다. 4096차원 residual stream의 layer 22에서 추정한 단일 방향을 12,479개 residual-writing 행렬에서 직교화하고, FP8 행렬은 자체 scale과 함께 재양자화해 공식 block-FP8 형식을 유지했다. JailbreakBench 테스트에서 유해 요청 거부율은 기반 모델의 0.891에서 0.094로 낮아졌고, MMLU·GSM8K 등 능력 지표는 공식 기반 모델과 ±1.5pp 이내였다. 안전 장치가 거의 없으므로 연구·red-teaming 환경에서만 별도 moderation 계층과 함께 사용하는 모델이다.
핵심 포인트
- 공식 GLM-5.3-Flash와 동일한 tensor 이름·dtype·shape를 유지한 block-FP8 drop-in checkpoint
- 단일 거부 방향을 12,479개 residual writer에 직교화해 유해 요청 거부율을 크게 낮춘 구조
- 320B 전체·18B 활성 MoE와 1M-token context, vision·video tower, MTP head를 그대로 보존
- 안전 정렬이 크게 제거되어 production 배포보다 refusal 연구와 통제된 red-teaming에 적합
제한사항
- 안전 guardrail이 크게 제거되어 유해·불법·공격적 요청에도 응답할 수 있으므로 자체 moderation 계층이 필요
- e4m3 재양자화 과정에서 거부 방향의 약 5%가 남아 모든 콘텐츠 범주에서 거부율이 0이 되지는 않음
- 보고된 능력 수치는 4개 벤치마크의 표본과 규칙 기반 거부 판정에 의존해 전체 평가를 대체하지 않음
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MaliciousInstruct | harmful refusal | 0.110 | 공식 기반 모델 0.960; 동일 스크립트·설정으로 측정 |
| JailbreakBench (harmful) | harmful refusal | 0.120 | 공식 기반 모델 0.930; 동일 스크립트·설정으로 측정 |
| ForbiddenQuestions | harmful refusal | 0.120 | 공식 기반 모델 0.593; 동일 스크립트·설정으로 측정 |
| AdvBench | harmful refusal | 0.150 | 공식 기반 모델 0.970; 동일 스크립트·설정으로 측정 |
| HarmBench (standard) | harmful refusal | 0.180 | 공식 기반 모델 0.933; 동일 스크립트·설정으로 측정 |
| StrongREJECT | harmful refusal | 0.273 | 공식 기반 모델 0.993; 동일 스크립트·설정으로 측정 |
| SimpleSafetyTests | harmful refusal | 0.340 | 공식 기반 모델 0.920; 동일 스크립트·설정으로 측정 |
| XSTest-safe | benign over-refusal | 0.004 | 공식 기반 모델 0.024; 안전해 보이는 benign prompt 250개에서 측정 |
| MMLU | accuracy | 0.827 | 공식 기반 모델 0.833; 차이 −0.7pp |
| MMLU-Pro | accuracy | 0.453 | 공식 기반 모델 0.438; 차이 +1.5pp |
| GSM8K (CoT) | accuracy | 0.940 | 공식 기반 모델 0.947; 차이 −0.7pp |
| CMMLU (Chinese) | accuracy | 0.860 | 공식 기반 모델 0.854; 차이 +0.6pp |
104
LIKES
684
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.