본문으로 건너뛰기
DeepMind Blog조회 1

Google DeepMind, 노트북용 멀티모달 모델 'Gemma 4 12B' 공개

Google DeepMind가 노트북 환경에서 구동 가능한 12B 규모의 멀티모달 모델 Gemma 4 12B를 공개했다.

섹션별 상세

Gemma 4 12B는 별도의 인코더 없이 시각 및 오디오 입력을 처리하는 통합 아키텍처를 도입했다.
시각 입력은 단일 행렬 곱셈과 정규화 모듈을 통해, 오디오 입력은 raw 신호를 텍스트 토큰과 동일한 차원으로 투영하여 LLM 백본이 직접 처리한다.
16GB VRAM 또는 통합 메모리 환경에서 구동 가능하며, 26B MoE 모델에 준하는 추론 성능을 발휘한다.
Multi-Token Prediction(MTP) 드래프터를 기본 탑재하여 추론 시 지연 시간을 효과적으로 감소시켰다.
Apache 2.0 라이선스로 배포되며, Hugging Face, Kaggle, vLLM, llama.cpp 등 다양한 개발 생태계를 지원한다.

용어 해설

인코더 프리 아키텍처(Encoder-free Architecture)
별도의 인코더 없이 멀티모달 입력을 LLM 백본에 직접 통합하는 방식. 인코더 분리 구조에서 발생하는 지연과 메모리 오버헤드를 제거하여 효율성을 높인다.
다중 토큰 예측(Multi-Token Prediction)
한 번의 추론 단계에서 여러 개의 토큰을 동시에 예측하는 기법. 추론 속도를 높이고 지연 시간을 줄이는 데 기여한다.
전문가 혼합(Mixture of Experts)
모델의 전체 파라미터 중 일부만 활성화하여 연산 효율을 극대화하는 구조. 대규모 모델의 성능을 유지하면서 추론 비용을 절감한다.

근거 모음

근거
  • Gemma 4 12B는 16GB VRAM 환경에서 구동 가능하다. Laptop ready 섹션
  • 26B MoE 모델에 근접하는 추론 성능을 제공한다. Run state-of-the-art agents locally 섹션

기술

  • Gemma 4 12B
  • Hugging Face
  • Kaggle
  • vLLM
  • llama.cpp
  • MLX
  • SGLang
  • Unsloth

활용 사례

  • local-inference
  • multimodal-reasoning
  • agentic-workflow
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 09.수집 2026. 06. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.