google/gemma-4-12B-it
Gemma 4 12B Unified는 이미지와 오디오를 인코더 없이 직접 임베딩으로 투영해 긴 컨텍스트(최대 256K)와 멀티모달 생성 기능을 제공하는 12B급 모델이다.
학습 방식 · 이 모델은 google/gemma-4-12B 기반의 사전학습된 가중치를 바탕으로 공개된 pre-trained 및 instruction-tuned 변형을 제공한다. 사전학습은 웹 문서, 코드, 수학 텍스트, 이미지, 오디오 등 다양한 모달리티를 포함하는 대규모 멀티모달 데이터로 수행되었고 데이터 컷오프는 2025년 1월이다. 모델 개발 과정에는 안전성 평가와 자동·인간 평가가 병행되어 안전성 성능 향상을 목표로 했다.
TL;DR
Gemma 4 12B Unified는 Google DeepMind가 공개한 멀티모달 12B급 모델로 이미지와 오디오를 별도 인코더 없이 경량 선형층으로 직접 임베딩해 단일 디코더로 처리하는 통합 아키텍처를 채택했다. 모델은 하이브리드 어텐션(슬라이딩 윈도우 + 마지막 레이어 글로벌), unified Keys/Values와 p-RoPE를 조합해 최대 256K 토큰의 긴 컨텍스트를 효율적으로 처리하도록 설계되었으며 이미지 토큰 예산과 Per-Layer Embeddings 같은 설계로 온디바이스 실행을 고려한 최적화를 제공한다. MoE 변형은 총 파라미터 대비 소수의 활성 파라미터를 사용해 추론 효율을 높이며 12B Unified는 멀티모달 생성·ASR·OCR·코딩 보조 등 다양한 작업에서 경쟁력 있는 성능을 보인다. 공개 Apache 2.0 라이선스와 오픈웨이트 제공으로 연구 및 배포 유연성이 높지만 데이터 편향과 사실 정확성 한계, 그리고 복잡한 멀티모달 파인튜닝에서의 제어와 안전성 검증은 여전히 고려해야 할 요소이다.
핵심 포인트
- 12B Unified 버전은 이미지와 오디오를 별도 인코더 없이 경량 선형층으로 투영해 단일 디코더로 모든 모달리티를 처리하는 점에서 차별화된다. 이 통합 방식은 멀티모달 파인튜닝의 단일 통로를 제공해 지연 시간과 시스템 복잡도를 낮춘다. 문서에서는 이 접근을 12B Unified의 핵심 차별점으로 명시하고 있다.
- 하이브리드 어텐션과 p-RoPE의 결합은 긴 컨텍스트 처리에서 위치 표현의 정합성을 유지하면서 메모리 사용을 최적화하는 설계적 차별점을 만든다. 대부분 레이어에서는 슬라이딩 윈도우로 효율을 확보하고 마지막 레이어에서 글로벌 어텐션을 적용해 전체 입력에 대한 통일된 인식을 확보한다. 이 설계는 문서 기반 응용과 장기 대화 기록 처리에서 실용적 이득을 제공한다.
- MoE 변형의 활성 파라미터(A4B) 표기는 총 파라미터 수와 실제 활성 파라미터를 분리해 대형 모델의 표현력과 추론 효율을 동시에 고려한 설계 철학을 보여준다. 활성 파라미터만으로 동작하도록 설계된 구조는 대규모 파라미터의 이점을 실무적으로 활용할 수 있게 한다. 문서에서는 이러한 설계가 실제 추론 속도와 비용 측면에서 이점을 제공한다고 명시되어 있다.
- 이 모델군은 멀티모달 입력을 단일 디코더로 통합하는 구조와 다양한 모델 크기를 함께 제공함으로써 온디바이스에서부터 서버 환경까지 폭넓은 배포 시나리오를 지원한다. Apache 2.0 라이선스로 오픈웨이트를 제공하므로 연구·상용 모두에서 접근성과 실험 유연성이 높다. 문서에서는 소형 모델은 모바일과 랩탑에, 12B 이상은 소비자 GPU와 워크스테이션에 적합하다고 명시되어 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU Pro | accuracy | 77.2% | — |
| AIME 2026 no tools | accuracy | 77.5% | — |
| LiveCodeBench v6 | accuracy | 72.0% | — |
| MRCR v2 8 needle 128k (long context) | average | 43.4% | — |
1.2k
LIKES
2.6M
DOWNLOADS
9 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.