Gemma 4 기반 31B 멀티모달 'CRACK v2' — thinking mode·안전성 튜닝 탑재
Gemma 4 31B 기반의 멀티모달 Dense 모델로 hybrid sliding/global attention과 float16 vision passthrough를 유지하며 Thinking Mode와 'CRACK v2' abliteration 안전 튜닝으로 HarmBench 93.7%를 보고했다.
TL;DR
이 모델은 google/gemma-4-31b-it를 기반으로 dealignai가 'CRACK v2' abliteration 안전 튜닝을 적용한 Gemma 4 31B Dense 멀티모달 모델이다. 하이브리드 슬라이딩/글로벌 어텐션과 float16 vision passthrough를 유지하며 JANG v2(MLX-native) safetensors 포맷으로 배포된다. README에서 보고한 핵심 수치는 HarmBench 281/300(93.7%), Security & Pentesting 8/8, MMLU 71.5%이며 v2는 거부 벡터 품질 개선과 Thinking Mode 안정성 향상을 목표로 했다. 추론 환경은 vMLX 실행을 권장하며 Thinking Mode 활성화 시 온도(0.3–0.7)와 repetition penalty(1.15–1.25) 같은 구체적 설정을 제시한다. 이러한 설정은 내부 계획 루프(생성 반복)를 완화하기 위한 것으로 README는 greedy 디코딩(temp=0)을 피할 것을 명시했다. 모델 파일 크기는 21GB로 표기되어 로컬 추론 요구사항이 비교적 높다. 결과적으로 이 모델은 멀티모달 추론과 안전성 규정 준수 간 균형을 목표로 한다. 장점은 높은 HarmBench 준수와 보안 프롬프트 통과, Gemma 4 특성에 맞춘 아키텍처 튜닝이다. 단점으로는 MMLU에서 원본 대비 약 5% 포인트 낮은 성능이 보고되었고 실행을 위해 권장되는 런타임(vMLX)과 높은 메모리 요구가 존재한다.
핵심 역량
- 이미지-텍스트 입력을 동시에 처리해 설명·질문응답·대화형 응답을 생성한다
- Chain-of-Thought 유사 동작을 지원하는 Thinking Mode로 복잡한 추론과 계획을 수행한다
- 보안·펜테스팅 관련 코드 예시 생성이 가능하며 README 상에서는 8/8 보안 프롬프트 통과를 보고했다
- 안전성 튜닝(거부 벡터 조정)으로 해로운 응답을 줄이려는 거부·필터링 행동을 보인다
강점
- HarmBench에서 281/300(93.7%)의 높은 규정 준수 수치를 보고해 안전성 평가 지표에서 강점을 보였다.
- 보안·펜테스팅 프롬프트에서 8/8 통과를 보고해 코드·보안 설명 생성 실용성이 입증되었다.
- 멀티모달 비전 인코더를 float16 passthrough로 유지해 이미지-텍스트 태스크에서 원본 비전 능력을 보존한다.
- JANG v2(MLX-native) 포맷으로 vMLX 런타임과 호환되어 해당 생태계에서 최적화된 추론 흐름을 제공한다.
훈련 방식
google/gemma-4-31b-it 기반에서 CRACK v2 'abliteration' 방식으로 거부 벡터 추출 품질을 개선하고 Gemma 4의 하이브리드 어텐션 특성에 맞춘 추론 안정성·thinking-mode 튜닝을 적용했다.
알아두면 좋은 것
- 권장 실행 환경은 vMLX이며 Thinking Mode·vision 기능·반복 페널티 등 세부 추론 설정이 필요하다
- 모델은 google/gemma-4-31b-it를 출처로 하며 JANG v2(MLX-native) safetensors 형식으로 배포되어 있다
- 비전 인코더는 float16 passthrough로 보존되어 멀티모달 입력을 지원하며 모델 파일 용량은 21GB로 표기되었다
- v2 업로드는 거부 벡터 품질 향상(abliteration 개선)과 Thinking Mode 안정성 개선을 포함한다
기술적 특징
- 하이브리드 슬라이딩/글로벌 어텐션 구성이 적용되어 장기 문맥과 필수 토큰에 대해 서로 다른 어텐션 범위를 사용한다. 이 설계는 긴 멀티모달 컨텍스트를 처리하면서 계산량을 절감하고 핵심 토큰의 전역적 의존성을 유지한다.
- 멀티모달 비전 인코더는 float16 passthrough로 보존되어 시각 입력 처리 시 정밀도와 효율성 균형을 유지한다. 비전 경로를 별도 저정밀화 없이 유지하므로 이미지-텍스트 상호작용 품질을 보존한다.
- CRACK v2 'abliteration'을 통해 거부(refusal) 벡터 추출 품질을 개선해 안전성 규칙 준수 행동을 조정했다. 결과적으로 HarmBench 전반에서 93.7%의 준수율과 특정 보안 프롬프트의 완전 통과를 보고했다.
- Thinking Mode를 위한 추론 파라미터 권장값(온도 0.3–0.7, repetition penalty 1.15–1.25 등)을 제시해 내부 계획 루프의 안정성을 확보했다. README는 greedy 디코딩(temp=0)에서 계획 루프가 악화될 수 있음을 명시해 실전 설정 지침을 제공한다.
- 모델은 JANG v2 MLX-native safetensors 포맷으로 패키징되어 vMLX 런타임과의 호환성·로딩 효율을 확보했다. 이 포맷은 Gemma 4 아키텍처 특성(하이브리드 어텐션·vision passthrough)에 최적화되어 있다.
차별점
- CRACK v2 abliteration으로 거부 벡터 품질을 개선해 안전성 규칙 준수(HarmBench 93.7%)와 거부 행동의 일관성을 목표로 한다
- Gemma 4의 hybrid sliding/global attention 구조에 맞춘 튜닝으로 긴 컨텍스트와 멀티모달 입력 처리에 최적화되었다
- 비전 인코더를 float16 passthrough로 유지해 이미지-언어 통합 능력을 보존하면서 MLX 생태계의 고유 포맷(JANG v2)을 사용한다
- Thinking Mode 관련 추론 설정 권장(온도·repetition penalty)과 반복 루프 방지를 위한 구체적 가이드라인을 제공한다
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| HarmBench (300 prompts) | compliance | 281/300 (93.7%) | — |
| Security & Pentesting | compliance | 8/8 (100%) | — |
| MMLU-200 | accuracy | 71.5% | base (google/gemma-4-31b-it): 76.5% (delta -5.0%) |
1.7k
Likes
49.4k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.