Gemma4 26B MoE 4-bit QAT에 MTP 탑재 Balanced Uncensored 빌드
Gemma4 26B-A4B 기반의 4-bit QAT 양자화 모델로 MTP speculative decoding을 포함하여 이미지-텍스트-투-텍스트 멀티모달 생성 속도를 약 35% 개선한 Balanced uncensored 빌드이다.
TL;DR
이 빌드는 Google의 Gemma 4 26B-A4B를 기반으로 QAT(4-bit) 가중치를 사용하여 크기와 메모리 요구를 낮추면서 원래 동작을 가깝게 유지하는 멀티모달 생성용 배포 빌드이다. 작성자는 응답 거부를 제거한 Balanced uncensored 튜닝과 함께 MTP(Multi-Token Prediction) 드래프트 헤드를 포함시켜 speculative decoding으로 생성 스루풋을 높였고, llama.cpp 환경에서 동일 품질 대비 약 35%의 속도 향상을 관찰했다고 보고했다. Vision 입력은 별도 mmproj 파일을 모델과 함께 로드하여 활성화하며 권장 샘플링 파라미터가 제공되어 빌드 전반의 동작 일관성을 맞추도록 설계되었다. 다만 성능·품질 측정치는 작성자가 특정 런타임(llama.cpp)에서 확인한 사례를 기반으로 하며 다른 환경이나 런타임에서는 결과가 달라질 수 있다.
핵심 역량
- 이미지 입력을 mmproj 파일과 함께 처리하여 텍스트 기반 응답으로 변환하는 멀티모달 생성 능력을 제공한다.
- Agentic한 코딩·추론·창작 시나리오에서 거부 없이 응답하도록 uncensored Balanced 튜닝이 적용되어 일관된 지시 이행 성향을 보인다.
- 4-bit QAT 기반 양자화로 모델 크기와 메모리 요구량을 줄이면서도 원저자의 동작과 유사한 품질을 유지하는 추론을 수행한다.
- MTP 드래프트 헤드를 통해 speculative decoding 방식으로 생성 스루풋을 높이고, 이후 검증 단계로 초안 토큰의 정확도를 유지하는 워크플로를 지원한다.
강점
- QAT 가중치를 사용하여 4-bit(Q4_K_M) 양자화 상태에서도 원저자의 동작에 근접하는 품질을 유지하도록 설계되어 경량화 환경에서 실용적인 추론 품질을 제공한다.
- MTP 드래프트 헤드를 통해 speculative decoding 기반의 병렬 초안 생성 후 검증 절차를 거쳐 약 35%의 생성 속도 향상을 달성했고, README는 해당 측정이 llama.cpp 환경에서 직접 테스트된 결과임을 명시한다.
- MoE 아키텍처(128 experts, 토큰당 8 active)를 채택하여 동일 파라미터 예산 대비 더 큰 모델 용량과 긴 컨텍스트(256K)를 처리할 수 있는 확장성을 확보했다.
훈련 방식
기반은 Google의 Gemma 4 26B-A4B이며, QAT(Quantization Aware Training) 가중치를 사용하여 4-bit 표현에서 품질을 보존하도록 최적화했으며 데이터셋·능력 변경 없이 uncensored 튜닝을 적용하여 응답 거부를 제거한 빌드이다.
알아두면 좋은 것
- 이 빌드는 공식 QAT 가중치를 기반으로 하여 데이터셋이나 모델 능력에 변화를 주지 않았으며, 단지 응답 거부(refusal)를 제거한 uncensored 구성이다. README는 기능적 변화를 가했다고 주장하지 않고 원저자가 의도한 동작을 그대로 유지하는 것을 목표로 했다고 기술한다. 따라서 원본 Gemma 4의 동작과 비교할 때 기능적 차이는 uncensoring과 MTP 관련 최적화에 국한된다.
- MTP 드래프트 헤드는 speculative decoding을 구현하여 병렬로 여러 토큰을 초안으로 생성하고, 모델이 각 초안 토큰을 검증하여 최종 출력을 확정하는 절차를 따른다. README에서는 이 과정을 통해 검증을 유지하면서 약 35%의 생성 속도 향상을 관찰했다고 보고한다. 해당 속도 측정은 작성자가 llama.cpp 환경에서 직접 테스트한 결과임이 명시되어 있다.
- Vision 입력은 별도 mmproj 파일을 모델과 함께 로드해야 하며, mmproj 파일은 비전 관련 가중치와 입력 파이프라인 구성을 포함한다. README에 제시된 예시는 llama-server 호출 시 --mmproj 옵션으로 mmproj 파일을 지정하는 방식이다. mmproj를 사용하면 이미지-텍스트 결합 파이프라인이 활성화된다.
- 권장 샘플링 파라미터(temperature 0.6, top_k 64, top_p 0.9, min_p 0.05, repeat_penalty 1.1)가 빌드 전체의 동작을 맞추기 위해 튜닝되어 제공된다. README는 이 설정들이 HauhauCS 빌드의 의도된 거동과 품질을 얻기 위한 엔드투엔드 튜닝 요소라고 명시한다. 런타임 호환성으로는 llama.cpp, LM Studio, Jan, koboldcpp 등 GGUF 런타임과 동작한다고 적혀 있다.
기술적 특징
- 모델은 MoE 구조로 설계되어 128개의 전문가를 보유하고 토큰당 8개의 전문가만 활성화한다. 이 방식은 모든 파라미터를 매번 계산하지 않고 선택적 활성화로 연산 효율을 확보하며 대규모 컨텍스트와 복합 태스크에서 표현력을 향상시킨다. MoE 선택은 멀티모달·추론 중심의 워크로드에서 확장성과 계산 효율을 동시에 달성하기 위한 설계적 판단이다.
- QAT(Quantization Aware Training)를 통해 4-bit 양자화에 대응하도록 가중치가 준비되어 있다. 학습 단계에서 양자화 영향을 반영하면 양자화 후 정밀도 저하를 줄일 수 있으며 README는 Q4_K_M 포맷이 Gemma 4에 최적화된 지점이라고 기술한다. 따라서 배포 시 모델 파일 크기와 메모리 요구를 크게 낮추면서도 원래 품질을 가깝게 유지한다는 장점이 있다.
- MTP 드래프트 헤드는 speculative decoding 계열을 구현하여 여러 토큰을 초안으로 생성한 뒤 모델이 각 초안 토큰을 검증하는 방식으로 동작한다. 이 과정은 병렬로 생성량을 늘려 전체 생성 지연을 줄이면서 검증 스텝으로 품질을 유지하므로 지연-품질 트레이드오프를 개선한다. README에서는 동일한 출력 품질에서 약 35%의 속도 향상을 관찰했다고 보고되어 있으며, 작성자는 llama.cpp 환경에서 이를 확인했다고 명시했다.
- 멀티모달 입력을 지원하기 위해 mmproj 형태의 비전 가중치 파일을 병렬로 로드하도록 구성되어 있다. mmproj는 이미지 전처리와 비전 헤드를 포함하여 텍스트 모델과의 연결 규약을 제공하므로 이미지-텍스트 융합 파이프라인을 간단히 활성화할 수 있다. 이 구성은 이미지-텍스트-투-텍스트 워크플로에서 손쉬운 배포를 가능하게 한다.
차별점
- 원저자의 Gemma 4 26B-A4B 기반에서 QAT 가중치를 사용하여 4-bit 환경에 특화된 배포용 빌드라는 점이 차별화 요소이다.
- 응답 거부를 제거한 uncensored Balanced 튜닝을 적용하여 agentic 코딩·추론·창작 시나리오에서 더 관대하고 지시 이행 성향을 보이는 점이 이 빌드의 특징이다.
- MTP 전용 드래프트 헤드를 포함하여 speculative decoding으로 생성 속도를 개선하면서 검증 단계로 품질을 유지하도록 설계된 점이 다른 표준 Gemma 배포와의 차이점이다.
- 대규모 컨텍스트(256K)와 MoE(128 experts) 조합을 통해 멀티모달·장문 컨텍스트 처리능력을 확보한 점이 실무적 활용성에서 이점을 제공한다.
54
Likes
35.2k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.