dealignai/Gemma-4-31B-JANG_4M-CRACK
Gemma 4 31B 기반의 멀티모달 Dense 모델로 hybrid sliding/global attention과 float16 vision passthrough를 유지하며 Thinking Mode와 'CRACK v2' abliteration 안전 튜닝으로 HarmBench 93.7%를 보고했다.
학습 방식 · google/gemma-4-31b-it 기반에서 CRACK v2 'abliteration' 방식으로 거부 벡터 추출 품질을 개선하고 Gemma 4의 하이브리드 어텐션 특성에 맞춘 추론 안정성·thinking-mode 튜닝을 적용했다.
TL;DR
이 모델은 google/gemma-4-31b-it를 기반으로 dealignai가 'CRACK v2' abliteration 안전 튜닝을 적용한 Gemma 4 31B Dense 멀티모달 모델이다. 하이브리드 슬라이딩/글로벌 어텐션과 float16 vision passthrough를 유지하며 JANG v2(MLX-native) safetensors 포맷으로 배포된다. README에서 보고한 핵심 수치는 HarmBench 281/300(93.7%), Security & Pentesting 8/8, MMLU 71.5%이며 v2는 거부 벡터 품질 개선과 Thinking Mode 안정성 향상을 목표로 했다. 추론 환경은 vMLX 실행을 권장하며 Thinking Mode 활성화 시 온도(0.3–0.7)와 repetition penalty(1.15–1.25) 같은 구체적 설정을 제시한다. 이러한 설정은 내부 계획 루프(생성 반복)를 완화하기 위한 것으로 README는 greedy 디코딩(temp=0)을 피할 것을 명시했다. 모델 파일 크기는 21GB로 표기되어 로컬 추론 요구사항이 비교적 높다. 결과적으로 이 모델은 멀티모달 추론과 안전성 규정 준수 간 균형을 목표로 한다. 장점은 높은 HarmBench 준수와 보안 프롬프트 통과, Gemma 4 특성에 맞춘 아키텍처 튜닝이다. 단점으로는 MMLU에서 원본 대비 약 5% 포인트 낮은 성능이 보고되었고 실행을 위해 권장되는 런타임(vMLX)과 높은 메모리 요구가 존재한다.
핵심 포인트
- CRACK v2 abliteration으로 거부 벡터 품질을 개선해 안전성 규칙 준수(HarmBench 93.7%)와 거부 행동의 일관성을 목표로 한다
- Gemma 4의 hybrid sliding/global attention 구조에 맞춘 튜닝으로 긴 컨텍스트와 멀티모달 입력 처리에 최적화되었다
- 비전 인코더를 float16 passthrough로 유지해 이미지-언어 통합 능력을 보존하면서 MLX 생태계의 고유 포맷(JANG v2)을 사용한다
- Thinking Mode 관련 추론 설정 권장(온도·repetition penalty)과 반복 루프 방지를 위한 구체적 가이드라인을 제공한다
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| HarmBench (300 prompts) | compliance | 281/300 (93.7%) | — |
| Security & Pentesting | compliance | 8/8 (100%) | — |
| MMLU-200 | accuracy | 71.5% | base (google/gemma-4-31b-it): 76.5% (delta -5.0%) |
1.7k
LIKES
49.4k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.