HauhauCS/Gemma4-26B-A4B-QAT-Uncensored-HauhauCS-Balanced-MTP
Gemma4 26B-A4B 기반의 4-bit QAT 양자화 모델로 MTP speculative decoding을 포함하여 이미지-텍스트-투-텍스트 멀티모달 생성 속도를 약 35% 개선한 Balanced uncensored 빌드이다.
학습 방식 · 기반은 Google의 Gemma 4 26B-A4B이며, QAT(Quantization Aware Training) 가중치를 사용하여 4-bit 표현에서 품질을 보존하도록 최적화했으며 데이터셋·능력 변경 없이 uncensored 튜닝을 적용하여 응답 거부를 제거한 빌드이다.
TL;DR
이 빌드는 Google의 Gemma 4 26B-A4B를 기반으로 QAT(4-bit) 가중치를 사용하여 크기와 메모리 요구를 낮추면서 원래 동작을 가깝게 유지하는 멀티모달 생성용 배포 빌드이다. 작성자는 응답 거부를 제거한 Balanced uncensored 튜닝과 함께 MTP(Multi-Token Prediction) 드래프트 헤드를 포함시켜 speculative decoding으로 생성 스루풋을 높였고, llama.cpp 환경에서 동일 품질 대비 약 35%의 속도 향상을 관찰했다고 보고했다. Vision 입력은 별도 mmproj 파일을 모델과 함께 로드하여 활성화하며 권장 샘플링 파라미터가 제공되어 빌드 전반의 동작 일관성을 맞추도록 설계되었다. 다만 성능·품질 측정치는 작성자가 특정 런타임(llama.cpp)에서 확인한 사례를 기반으로 하며 다른 환경이나 런타임에서는 결과가 달라질 수 있다.
핵심 포인트
- 원저자의 Gemma 4 26B-A4B 기반에서 QAT 가중치를 사용하여 4-bit 환경에 특화된 배포용 빌드라는 점이 차별화 요소이다.
- 응답 거부를 제거한 uncensored Balanced 튜닝을 적용하여 agentic 코딩·추론·창작 시나리오에서 더 관대하고 지시 이행 성향을 보이는 점이 이 빌드의 특징이다.
- MTP 전용 드래프트 헤드를 포함하여 speculative decoding으로 생성 속도를 개선하면서 검증 단계로 품질을 유지하도록 설계된 점이 다른 표준 Gemma 배포와의 차이점이다.
- 대규모 컨텍스트(256K)와 MoE(128 experts) 조합을 통해 멀티모달·장문 컨텍스트 처리능력을 확보한 점이 실무적 활용성에서 이점을 제공한다.
54
LIKES
35.2k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.