로컬에서 이미지·오디오·텍스트를 한 모델로 처리하는 Gemma 4 12B Unified (GGUF)
Google DeepMind의 Gemma 4 12B Unified를 Unsloth가 GGUF 형태로 배포한 멀티모달(텍스트·이미지·오디오) 디코더형 모델로, 인코더 없이 이미지·오디오를 직접 임베딩으로 투영해 로컬·llama.cpp 환경에서 대용량 컨텍스트(최대 256K)로 동작한다.
TL;DR
Gemma 4 12B Unified는 Google DeepMind가 설계한 멀티모달 Gemma 4 계열의 12B 변형으로, Unsloth가 GGUF 형태로 배포해 로컬 환경에서 텍스트·이미지·오디오 입력을 모두 처리할 수 있도록 구성되었다. 이 모델은 인코더를 제거하고 이미지 패치와 오디오 파형을 경량 선형 투영으로 디코더 임베딩에 직접 넣는 '인코더-프리' 설계를 채택해 멀티모달 파이프라인 지연을 줄이고 전체 모델을 한 번에 fine-tune할 수 있다. 아키텍처 측면에서 Gemma 4 12B는 로컬 슬라이딩 윈도우와 전역 어텐션을 교차 적용하는 하이브리드 어텐션을 사용하며, unified Keys/Values와 Proportional RoPE로 256K 토큰 크기의 긴 컨텍스트 메모리를 최적화했다. 모델 패밀리는 Dense와 MoE 변형을 포함하며, 12B Unified는 이미지·오디오·텍스트를 네이티브로 수용하고 다양한 벤치마크(MMLU 77.2%, LiveCodeBench 72.0%, Codeforces ELO 1659 등)에서 중형 모델로서 균형 잡힌 성능을 보였다. 이 배포는 GGUF 포맷과 llama.cpp/llama-server 호환성을 통해 로컬 추론을 즉시 가능하게 하고, 멀티모달 토큰 예산(70–1120)과 오디오/비디오 길이 제한(오디오 30초, 비디오 60초)을 통해 실전 활용에서 품질·속도를 조정할 수 있다. 트레이드오프로는 모델이 여전히 사전학습 데이터와 지침튜닝 범위에 따라 편향·사실성 한계를 가지며, 최종 안전성·정확성 보장은 애플리케이션 레벨의 검증이 필요하다.
핵심 역량
- 텍스트 생성·요약·대화: 시스템·assistant·user 역할 기반의 채팅과 내장된 thinking 모드 지원
- 이미지 이해: variable aspect ratio·가변 비주얼 토큰 예산을 사용한 캡션, OCR, 도큐먼트 파싱, 차트·UI 해석
- 오디오 처리(12B 포함): ASR 및 자동 음성 번역, 30초 이하 오디오 입력 지원
- 비디오 처리: 프레임 시퀀스(기본 1fps) 방식으로 최대 60초 분량 분석
- 긴 문맥 처리: 최대 256K 토큰 컨텍스트를 지원해 장문 추론·문서 이해에 활용
강점
- 통합 멀티모달 처리: 인코더를 제거하고 이미지/오디오를 직접 임베딩으로 투영해 멀티모달 파이프라인 지연을 줄였으며 로컬 파이프라인에서 편리하게 배포할 수 있다.
- 긴 컨텍스트와 장문 성능: 12B 모델임에도 256K 토큰 컨텍스트를 지원해 문서 수준의 장문 추론 및 문맥 유지에 유리하다 (README 표에 256K 명시).
- 실사용 벤치마크 경쟁력: MMLU 77.2%, LiveCodeBench 72.0%, Codeforces ELO 1659 등 다양한 벤치마크에서 중형 모델로서 균형 있는 성능을 보였다.
훈련 방식
기반 모델은 google/gemma-4-12B-it이며, 대규모 멀티모달 사전학습(웹 문서·코드·이미지·오디오, 컷오프 2025-01)과 이후 Instruction-tuning을 통해 텍스트·이미지·오디오 입력에 대한 응답 생성 능력을 갖추었다.
알아두면 좋은 것
- 이 배포는 GGUF 포맷의 'omni GGUF'로, 하나의 파일로 텍스트·이미지·오디오를 처리하며 llama.cpp/llama-server에서 mmproj(멀티모달 프로젝터)를 자동으로 내려받아 작동한다.
- Gemma 4 12B Unified는 인코더-프리 설계로 이미지 패치와 오디오 파형을 경량 선형 투영으로 디코더 임베딩에 직접 넣어 멀티모달 지연과 파라미터 중복을 줄였다.
- 컨텍스트 길이는 256K 토큰이며, 하이브리드 어텐션(로컬 슬라이딩 윈도우 + 전역 계층), unified K/V와 p-RoPE로 긴 문맥 메모리를 최적화했다.
- 라이선스는 Apache-2.0, 학습 데이터 컷오프는 2025년 1월이며 사전·지침튜닝(Instruction-tuned) 변형이 제공된다.
기술적 특징
- 인코더-프리 통합(multimodal unified): 12B Unified는 이미지 패치와 오디오 파형을 별도 비전/오디오 인코더 없이 경량 선형 레이어로 직접 디코더 임베딩에 투영한다. 이로 인해 멀티모달 입력이 단일 디코더형 Transformer에서 처리되어 fine-tuning·배포 파이프라인이 단순해진다.
- 하이브리드 어텐션과 장문 최적화: 로컬 슬라이딩 윈도우 어텐션을 전역 어텐션과 교차시키고 마지막 레이어는 항상 전역 어텐션으로 유지해 계산량을 낮추면서도 전체 문맥에 대한 글로벌 인지를 확보한다. 추가로 unified Keys/Values와 Proportional RoPE를 적용해 긴 컨텍스트의 메모리 사용을 최적화했다.
- 모델 패밀리 설계(Dense + MoE): Gemma 4는 Dense와 MoE 변형을 함께 제공해 배포 목표별로 선택할 수 있다(예: 26B A4B는 25.2B 전체 중 활성 파라미터 3.8B로 빠른 추론을 구현). 이로써 동일한 설계 철학으로 다양한 성능/효율 트레이드오프를 제공한다.
- 온디바이스 효율화(PE, PLE 등): 소형 모델(E2B/E4B)은 Per-Layer Embeddings(PLE)를 사용해 효율적인 파라미터 활용을 달성했으며, Unsloth의 GGUF 및 양자화 도구와 결합하면 로컬 환경(휴대폰·노트북)에서 실행 가능하다.
- 멀티모달 토큰 예산과 실용 설정: 이미지 표현을 위한 가변 비주얼 토큰 예산(70–1120)을 제공해 분류·캡션·OCR과 같은 작업별로 품질·속도의 균형을 조정할 수 있다.
차별점
- 인코더-프리 unified 흐름으로 이미지·오디오를 별도 인코더 없이 디코더에 직접 투영해 멀티모달 파이프라인을 단순화함
- 12B 모델에서 256K 토큰까지 지원해 중형 모델임에도 장문 처리 능력을 확보함
- Unsloth가 GGUF 형태로 배포하며 llama.cpp/llama-server에서 mmproj를 자동으로 받아 로컬 멀티모달 실행이 즉시 가능함
- Dense와 MoE 변형을 같은 가족으로 제공해 배포 시 성능·지연 요구에 맞춰 선택할 수 있음
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU Pro | accuracy | 77.2% | — |
| AIME 2026 no tools | accuracy | 77.5% | — |
| LiveCodeBench v6 | accuracy | 72.0% | — |
| Codeforces ELO | ELO | 1659 | — |
| GPQA Diamond | accuracy | 78.8% | — |
| Tau2 (average over 3) | accuracy | 69.0% | — |
| MMMU Pro (Vision) | accuracy | 69.1% | — |
| OmniDocBench 1.5 (Vision) | average edit distance (lower better) | 0.164 | — |
| MATH-Vision | accuracy | 79.7% | — |
이미지 분석

689
Likes
1.3M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.