본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

HauhauCS/Gemma4-12B-QAT-Uncensored-HauhauCS-Balanced

image-text-to-text 파이프라인을 통한 멀티모달 입력을 받아 텍스트 응답을 생성하는 작업을 수행한다. 이 모델은 이미지와 텍스트를 결합한 입력을 처리하도록 mmproj 파일과 함께 로드되어 비전-텍스트 변환 흐름을 지원한다. 파이프라인 태그와 실행 예제는 멀티모달 추론 워크플로에 맞춰져 있다.12B dense256K 컨텍스트gemma

Gemma4-12B의 QAT 가중치를 Q4_K_M 포맷으로 배포한 uncensored Balanced 릴리스로서 mmproj 기반 이미지 입력과 MTP speculative drafter를 포함하여 생성 속도를 높이면서 원저자의 기능을 유지한다.

학습 방식 · 기반 모델은 Google/DeepMind의 Gemma 4 12B이며 공식 QAT(Quantization Aware Training) 가중치를 사용하여 4비트 양자화 상태로 배포되었고 데이터셋 변경 없이 uncensored 동작으로 튜닝되었다.

TL;DR

이 배포는 Google/DeepMind의 Gemma 4 12B를 기반으로 공식 QAT 가중치를 사용해 Q4_K_M 포맷으로 제공되는 멀티모달 모델로서 원저자의 기능을 유지한 채 거부 응답을 제거한 uncensored Balanced 변형을 포함한다. 핵심 기술은 QAT 기반의 4비트 양자화로 용량을 줄이면서도 품질을 보전하는 점과 MTP 초안 헤드를 통한 speculative decoding으로 약 60%의 생성 속도 향상을 보고한 점이며, mmproj 파일을 병행 로드하여 이미지-텍스트 입력 파이프라인을 활성화하도록 설계되어 있다. 배포 파일과 권장 샘플링 설정이 명시되어 있어 로컬 GGUF 런타임에서 바로 사용 가능하며 일부 런타임 모드에서의 안정성 이슈가 보고되어 단일 GPU의 특정 분할 모드 사용이 권장된다는 한계가 있다.

핵심 포인트

  • 원저자 의도를 유지한 채로 거부 응답을 제거한 uncensored Balanced 변형을 제공하여 에이전틱 코딩과 창작적 작업에서 더 관대하고 지시 중심의 출력을 지향한다.
  • 배포에 전용 MTP 초안 헤드를 포함하여 speculative decoding을 염두에 둔 엔드투엔드 튜닝을 제공함으로써 속도와 품질을 동시에 목표로 삼았다.
  • Gemma 4의 공식 QAT 가중치를 그대로 사용하여 Q4_K_M 포맷으로 최적화된 배포를 제공하며 README에서 Q4_K_M을 권장 포맷으로 명시하고 있다.
  • 멀티모달 연동을 위해 별도의 mmproj 비전 파일을 함께 제공하여 이미지 입력을 활성화하는 명시적 배포 방식을 채택하고 있다.

벤치마크

벤치마크지표비교
MTP speculative decodinggeneration speedup≈60% fastertested by author with llama.cpp; output quality reported as identical

155

LIKES

88.1k

DOWNLOADS

2 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.