256K 컨텍스트와 통합 멀티모달 12B 모델
Gemma 4 12B Unified는 이미지와 오디오를 인코더 없이 직접 임베딩으로 투영해 긴 컨텍스트(최대 256K)와 멀티모달 생성 기능을 제공하는 12B급 모델이다.
TL;DR
Gemma 4 12B Unified는 Google DeepMind가 공개한 멀티모달 12B급 모델로 이미지와 오디오를 별도 인코더 없이 경량 선형층으로 직접 임베딩해 단일 디코더로 처리하는 통합 아키텍처를 채택했다. 모델은 하이브리드 어텐션(슬라이딩 윈도우 + 마지막 레이어 글로벌), unified Keys/Values와 p-RoPE를 조합해 최대 256K 토큰의 긴 컨텍스트를 효율적으로 처리하도록 설계되었으며 이미지 토큰 예산과 Per-Layer Embeddings 같은 설계로 온디바이스 실행을 고려한 최적화를 제공한다. MoE 변형은 총 파라미터 대비 소수의 활성 파라미터를 사용해 추론 효율을 높이며 12B Unified는 멀티모달 생성·ASR·OCR·코딩 보조 등 다양한 작업에서 경쟁력 있는 성능을 보인다. 공개 Apache 2.0 라이선스와 오픈웨이트 제공으로 연구 및 배포 유연성이 높지만 데이터 편향과 사실 정확성 한계, 그리고 복잡한 멀티모달 파인튜닝에서의 제어와 안전성 검증은 여전히 고려해야 할 요소이다.
핵심 역량
- 모델은 내장된 사고 모드로 단계적 추론을 수행하는 기능을 제공하며 thinking 모드를 통해 내부 추론 토큰을 출력하고 최종 응답을 분리할 수 있다. 이 사고 모드는 시스템 프롬프트에 지정된 제어 토큰으로 활성화하거나 비활성화할 수 있어 단계적 추론과 표준 생성 사이를 전환할 수 있다. 대화형 에이전트 워크플로에서는 structured function calling과 연계해 도구 호출 기반 작업을 수행할 수 있다.
- 긴 문맥 처리를 위해 최대 256K 토큰의 컨텍스트 창을 지원하며 하이브리드 어텐션 설계로 지역적 슬라이딩 윈도우와 마지막 레이어의 글로벌 어텐션을 결합해 메모리 사용을 최적화한다. 글로벌 레이어는 unified Keys/Values와 p-RoPE를 적용해 장문에서의 위치 정합과 메모리 효율을 유지한다. 이 설계는 문서 요약, 장기 대화 기록 유지, 긴 코드베이스 이해 등에서 유리하게 작동한다.
- 이미지 입력은 가변 해상도와 종횡비를 허용하며 이미지 패치들을 경량 선형층으로 임베딩해 디코더로 직접 유입한다. 이 흐름은 이미지 분류, OCR, 문서 파싱, UI 스크린 이해, 차트 해석 등의 시각적 정보 추출에 적합하다. 이미지 표현은 시각 토큰 예산(70, 140, 280, 560, 1120)을 사용해 세부 정보와 연산 비용 사이의 균형을 조정할 수 있다.
- 오디오 기능은 E2B, E4B, 12B 모델에서 네이티브로 지원되며 30초 이내의 오디오를 처리해 ASR과 자동 음성 번역 작업을 수행한다. 오디오는 텍스트 프롬프트 뒤에 배치하는 것이 권장되며 지정된 출력 형식을 엄격히 맞추도록 프롬프트를 설계해야 한다. 이 처리 파이프라인은 오디오를 직접 임베딩 공간으로 투영한 뒤 디코더에서 텍스트로 변환하는 흐름을 따른다.
- 코드 생성과 수리 작업에서 성능 개선이 보고되었으며 네이티브 function-calling 지원으로 에이전트형 자동화에 활용할 수 있다. 모델은 다양한 언어에서의 코딩 보조, 완성, 오류 수정에 적용 가능하며 LiveCodeBench 등 벤치마크에서 점수가 제시되어 있다. 이러한 기능은 자동화된 도구 체인과 결합해 복합 작업을 처리하는 데 유용하다.
강점
- 이 모델군은 멀티모달 입력을 단일 디코더로 통합하는 구조와 다양한 모델 크기를 함께 제공함으로써 온디바이스에서부터 서버 환경까지 폭넓은 배포 시나리오를 지원한다. Apache 2.0 라이선스로 오픈웨이트를 제공하므로 연구·상용 모두에서 접근성과 실험 유연성이 높다. 문서에서는 소형 모델은 모바일과 랩탑에, 12B 이상은 소비자 GPU와 워크스테이션에 적합하다고 명시되어 있다.
- 긴 컨텍스트와 시각·청각 처리를 결합한 통합 설계는 멀티모달 응용에서 지연 시간을 줄이고 파인튜닝 복잡도를 낮추는 실용적 이점을 제공한다. 이미지와 오디오를 별도 인코더 없이 선형 투영해 디코더로 직접 유입시키므로 멀티모달 파이프라인이 단순해진다. 문서에서는 이 접근이 멀티모달 지연 시간과 시스템 복잡도를 줄인다고 기술하고 있다.
- MoE 변형은 총 파라미터가 큰 것과 달리 활성 파라미터만으로 추론을 수행해 추론 속도와 비용 측면에서 효율을 달성한다. 26B A4B 모델의 사례처럼 활성 파라미터 3.8B로 동작해 4B 급 모델과 유사한 실행 속도를 얻을 수 있다. 이 특성은 대형 모델의 성능을 어느 정도 유지하면서도 실제 운영 비용을 낮추려는 배포에 유리하다.
훈련 방식
이 모델은 google/gemma-4-12B 기반의 사전학습된 가중치를 바탕으로 공개된 pre-trained 및 instruction-tuned 변형을 제공한다. 사전학습은 웹 문서, 코드, 수학 텍스트, 이미지, 오디오 등 다양한 모달리티를 포함하는 대규모 멀티모달 데이터로 수행되었고 데이터 컷오프는 2025년 1월이다. 모델 개발 과정에는 안전성 평가와 자동·인간 평가가 병행되어 안전성 성능 향상을 목표로 했다.
알아두면 좋은 것
- Gemma 4 12B Unified는 인코더를 없앤 통합 아키텍처로 이미지 패치와 오디오 파형을 선형 투영해 디코더에 바로 주입함으로써 멀티모달 지연 시간을 줄이고 단일 파라미터 집합으로 끝까지 파인튜닝이 가능하다. 이 통합 설계는 멀티모달 입력을 처리하는 파이프라인을 단순화하고 멀티모달 미세조정 과정에서 별도 인코더를 유지할 필요를 제거한다. 문서에서는 이 점을 12B Unified의 핵심 차별점으로 명확히 제시하고 있다.
- 모델군은 Dense와 MoE 변형을 모두 제공하며 12B는 11.95B 총 파라미터, 26B A4B는 총 25.2B 파라미터에 활성 파라미터 3.8B로 동작하는 식으로 다양한 배포 요구를 충족한다. MoE 변형은 입력마다 일부 전문가만 활성화함으로써 큰 총 파라미터 대비 낮은 추론 비용을 달성하도록 설계되었다. 문서에서는 MoE가 4B급 모델에 가까운 실행 속도로 동작한다고 명시되어 있다.
- 컨텍스트 길이는 모델 크기별로 상이하며 소형 모델은 128K, 중형 이상 모델은 256K 토큰까지 지원한다. 대형 컨텍스트 처리를 위해 하이브리드 어텐션과 p-RoPE, unified KV 설계를 병행해 메모리와 위치 표현을 최적화했다. 이로 인해 문서 기반 QA나 장기 추적 대화 시 문맥 유지 능력이 향상된다.
- 모델은 Apache 2.0 라이선스로 공개되어 있으며 사전학습 및 instruction-tuned 변형 모두 오픈웨이트로 제공된다. 공개 라이선스와 공개된 모델 가중치는 연구와 엔지니어링에서 자유로운 실험과 배포를 용이하게 한다. 문서에는 관련 라이선스 링크와 추가 문서 링크가 포함되어 있다.
기술적 특징
- Gemma 4 12B Unified는 인코더를 배제하고 이미지 패치와 오디오 파형을 경량 선형층으로 직접 임베딩해 디코더 전용 Transformer로 투입하는 통합 아키텍처를 채택했다. 이 설계는 멀티모달 입력마다 별도의 인코더를 실행하는 오버헤드를 제거해 멀티모달 지연 시간과 파인튜닝 복잡도를 줄였다. 결과적으로 단일 파라미터 집합으로 모든 모달리티를 끝까지 미세조정할 수 있다.
- 하이브리드 어텐션은 슬라이딩 윈도우 기반의 지역적 어텐션과 마지막 레이어의 글로벌 어텐션을 교차 적용해 긴 문맥을 효율적으로 처리하도록 설계되어 있다. 글로벌 레이어에는 unified Keys/Values와 p-RoPE를 적용해 위치 표현의 정합성과 메모리 효율을 동시에 개선했다. 이 조합은 128K·256K 같은 대용량 컨텍스트에서 의미관계를 유지하면서도 메모리 사용을 제어하는 역할을 한다.
- 소형 모델에는 Per-Layer Embeddings라는 설계를 사용해 레이어별로 작은 임베딩 테이블을 두고 토큰당 레이어별 임베딩을 조회함으로써 effective parameter를 최적화했다. 이 접근은 레이어 수를 늘리지 않으면서도 표현 용량을 확장해 온디바이스 실행 시 효율성을 높인다. 문서에서는 E2B·E4B에서 이 방식이 온디바이스 배포에 기여한다고 명시되어 있다.
- MoE 변형은 다수의 전문가를 보유하되 입력마다 일부 전문가만 활성화하는 방식으로 활성 파라미터 집합을 작게 유지함으로써 추론 효율을 확보한다. Gemma 4 26B A4B는 총 25.2B 파라미터를 가지면서 활성 파라미터는 3.8B로 동작하도록 설계되어 대형 모델 대비 실질 추론 비용을 줄였다. 이 설계는 대형 모델의 표현력을 유지하면서도 실제 운영 부담을 낮추는 트레이드오프로 작동한다.
- 시각 표현은 가변 해상도와 시각 토큰 예산을 통해 세부 정보와 연산 비용 사이를 조절하도록 설계되었다. 지원되는 토큰 예산 값은 70, 140, 280, 560, 1120이며 높은 예산은 OCR 및 문서 파싱 같은 세부 정보가 중요한 작업에 유리하다. 이 메커니즘은 하나의 모델로 다양한 시각 작업을 처리할 수 있도록 연산/정확도 균형을 조정하게 한다.
차별점
- 12B Unified 버전은 이미지와 오디오를 별도 인코더 없이 경량 선형층으로 투영해 단일 디코더로 모든 모달리티를 처리하는 점에서 차별화된다. 이 통합 방식은 멀티모달 파인튜닝의 단일 통로를 제공해 지연 시간과 시스템 복잡도를 낮춘다. 문서에서는 이 접근을 12B Unified의 핵심 차별점으로 명시하고 있다.
- 하이브리드 어텐션과 p-RoPE의 결합은 긴 컨텍스트 처리에서 위치 표현의 정합성을 유지하면서 메모리 사용을 최적화하는 설계적 차별점을 만든다. 대부분 레이어에서는 슬라이딩 윈도우로 효율을 확보하고 마지막 레이어에서 글로벌 어텐션을 적용해 전체 입력에 대한 통일된 인식을 확보한다. 이 설계는 문서 기반 응용과 장기 대화 기록 처리에서 실용적 이득을 제공한다.
- MoE 변형의 활성 파라미터(A4B) 표기는 총 파라미터 수와 실제 활성 파라미터를 분리해 대형 모델의 표현력과 추론 효율을 동시에 고려한 설계 철학을 보여준다. 활성 파라미터만으로 동작하도록 설계된 구조는 대규모 파라미터의 이점을 실무적으로 활용할 수 있게 한다. 문서에서는 이러한 설계가 실제 추론 속도와 비용 측면에서 이점을 제공한다고 명시되어 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU Pro | accuracy | 77.2% | — |
| AIME 2026 no tools | accuracy | 77.5% | — |
| LiveCodeBench v6 | accuracy | 72.0% | — |
| MRCR v2 8 needle 128k (long context) | average | 43.4% | — |
1.2k
Likes
2.6M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.