Gemma 4 기반 QAT 4비트 무검열 Balanced 배포, MTP로 속도 향상 포함
image-text-to-text 파이프라인을 통한 멀티모달 입력을 받아 텍스트 응답을 생성하는 작업을 수행한다. 이 모델은 이미지와 텍스트를 결합한 입력을 처리하도록 mmproj 파일과 함께 로드되어 비전-텍스트 변환 흐름을 지원한다. 파이프라인 태그와 실행 예제는 멀티모달 추론 워크플로에 맞춰져 있다.12B dense256K 컨텍스트gemma
Gemma4-12B의 QAT 가중치를 Q4_K_M 포맷으로 배포한 uncensored Balanced 릴리스로서 mmproj 기반 이미지 입력과 MTP speculative drafter를 포함하여 생성 속도를 높이면서 원저자의 기능을 유지한다.
TL;DR
이 배포는 Google/DeepMind의 Gemma 4 12B를 기반으로 공식 QAT 가중치를 사용해 Q4_K_M 포맷으로 제공되는 멀티모달 모델로서 원저자의 기능을 유지한 채 거부 응답을 제거한 uncensored Balanced 변형을 포함한다. 핵심 기술은 QAT 기반의 4비트 양자화로 용량을 줄이면서도 품질을 보전하는 점과 MTP 초안 헤드를 통한 speculative decoding으로 약 60%의 생성 속도 향상을 보고한 점이며, mmproj 파일을 병행 로드하여 이미지-텍스트 입력 파이프라인을 활성화하도록 설계되어 있다. 배포 파일과 권장 샘플링 설정이 명시되어 있어 로컬 GGUF 런타임에서 바로 사용 가능하며 일부 런타임 모드에서의 안정성 이슈가 보고되어 단일 GPU의 특정 분할 모드 사용이 권장된다는 한계가 있다.
핵심 역량
- 이미지와 텍스트를 결합한 멀티모달 입력을 받아 일관된 텍스트 출력을 생성할 수 있다.
- QAT 기반 4비트 양자화로 저장 용량을 줄인 상태에서 원저자의 기능을 유지하며 텍스트 품질을 보존한다.
- MTP speculative drafter를 사용하면 초안 생성 후 각 토큰을 검증하는 방식으로 생성 속도를 크게 높일 수 있다.
- llama.cpp 등 GGUF 런타임과의 호환성을 바탕으로 로컬 추론 환경에 바로 배포하여 사용할 수 있다.
강점
- QAT 가중치를 기반으로 한 4비트 배포이므로 원저자의 출력 품질에 가깝게 유지되면서 파일 크기와 메모리 요구량을 낮춘 배포 형태라는 점이 장점으로 제시되어 있다.
- MTP 초안 헤드를 포함하여 speculative decoding 방식으로 전체 생성 속도를 약 60% 향상시켰다고 보고되어 실사용 환경에서 응답 지연을 줄이는 혜택이 있다.
- llama.cpp 등 여러 GGUF 런타임과 호환되며 mmproj를 병행 로드하면 이미지-텍스트 멀티모달 추론을 로컬 환경에서 즉시 실행할 수 있다는 점이 배포 실용성에서 유리하다.
훈련 방식
기반 모델은 Google/DeepMind의 Gemma 4 12B이며 공식 QAT(Quantization Aware Training) 가중치를 사용하여 4비트 양자화 상태로 배포되었고 데이터셋 변경 없이 uncensored 동작으로 튜닝되었다.
알아두면 좋은 것
- 이 릴리스는 공식 QAT 가중치 기반으로 만들어져서 데이터셋이나 모델 능력 자체에는 변경이 없고 거부 응답을 제거한 uncensored 동작을 목표로 한다.
- 배포 파일 목록에 Q4_K_M 형태의 gguf 모델 파일과 BF16 mmproj 비전 파일, 그리고 MTP 초안 헤드 파일이 포함되어 있으며 각 파일의 크기(6.9GB, 168MB, 242MB)가 명시되어 있다.
- MTP 초안 헤드로 약 60% 빠른 생성 속도를 보고했으며 저자가 속도 측정을 llama.cpp 환경에서 직접 수행했다고 명시되어 있다.
- 권장 샘플링 설정(temperature 0.6, top_k 64, top_p 0.9, min_p 0.05, repeat_penalty 1.1)이 이 빌드에 최적화되어 배포 기본값과 차이가 있음을 표기하고 있다.
기술적 특징
- QAT 기반 4비트 배포는 학습 단계에서 양자화 영향을 반영한 가중치를 사용하여 저비트 포맷에서도 풀정밀도에 가까운 출력을 유지하도록 설계되어 있다. README에서는 Q4_K_M을 'sweet spot'으로 지적하며 더 높은 정밀도 양자화는 실질적 품질 향상 없이 용량만 증가한다고 명시하고 있다.
- MTP(Multi-Token Prediction) 초안 헤드는 speculative decoding 패턴을 적용하여 여러 토큰을 초안으로 생성한 뒤 모델이 각 초안 토큰을 검증하는 흐름으로 동작한다. 이 접근 방식은 초안 생성과 검증을 분리해 반복 호출을 줄이고 병렬 처리 이점을 활용함으로써 생성 속도 약 60% 향상을 달성했다고 보고되었다.
- 멀티모달 입력은 mmproj 파일을 모델과 함께 로드하는 방식으로 활성화되며 mmproj는 이미지 입력의 전처리 및 멀티모달 매핑을 담는 프로젝트 파일 역할을 한다. README의 실행 예제는 mmproj 병행 로드를 통해 이미지-텍스트 파이프라인을 구성하는 구체적 방법을 제공한다.
- 배포는 GGUF 런타임 호환성에 초점을 맞추어 llama.cpp, LM Studio, Jan, koboldcpp 등과의 작동을 명시하고 있으며 일부 환경(예: LM Studio의 tensor-split 모드)에서 안정성 이슈가 보고되어 단일 GPU의 layer-split 또는 우선순위 모드 사용을 권장하고 있다.
차별점
- 원저자 의도를 유지한 채로 거부 응답을 제거한 uncensored Balanced 변형을 제공하여 에이전틱 코딩과 창작적 작업에서 더 관대하고 지시 중심의 출력을 지향한다.
- 배포에 전용 MTP 초안 헤드를 포함하여 speculative decoding을 염두에 둔 엔드투엔드 튜닝을 제공함으로써 속도와 품질을 동시에 목표로 삼았다.
- Gemma 4의 공식 QAT 가중치를 그대로 사용하여 Q4_K_M 포맷으로 최적화된 배포를 제공하며 README에서 Q4_K_M을 권장 포맷으로 명시하고 있다.
- 멀티모달 연동을 위해 별도의 mmproj 비전 파일을 함께 제공하여 이미지 입력을 활성화하는 명시적 배포 방식을 채택하고 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MTP speculative decoding | generation speedup | ≈60% faster | tested by author with llama.cpp; output quality reported as identical |
155
Likes
88.1k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.