본문으로 건너뛰기

Gemma 4 기술 보고서: 멀티모달·장문 맥락·효율성 강화를 위한 Dense 및 MoE 모델군

Gemma 4는 dense와 MoE 아키텍처를 포함한 멀티모달 모델군으로 p p -RoPE·KV 캐시 공유·MTP 드래프터·양자화 인식 학습을 결합해 장문 처리와 추론·메모리 효율을 개선하고 공개 라이선스로 배포되었다.

용어 해설

KV 캐시(KV Cache)
Transformer 추론에서 키(key)와 값(value)을 토큰별로 저장하여 미래 토큰 생성 시 재사용하는 메모리 레이어로, 긴 컨텍스트에서 메모리와 대역폭을 크게 차지하므로 공유·재사용·압축 기법으로 최적화가 중요하다.
p p -RoPE
RoPE 계열의 위치 인코딩 변형으로서, 글로벌 레이어에 다른 주파수 스케일(p)을 적용해 위치 표현을 조정하고 글로벌 KV 캐시 크기를 줄이는 방식으로 긴 문맥 처리 효율을 개선하는 기법이다.
양자화 인식 학습(Quantization-Aware Training)
모델 파라미터와 활성화를 저비트 표현으로 변환할 때 발생하는 품질 저하를 학습 단계에서 모사하여 보정하는 방법으로, 추론 시 메모리·지연 감소를 유지하면서 성능 손실을 최소화한다.
추정적 디코딩(Speculative Decoding)
작은 드래프터가 미래 토큰을 빠르게 예측하고 메인 모델의 정식 디코딩을 병렬로 진행하여 전체 디코딩 지연을 줄이는 전략으로, 드래프터의 수용률과 집단 확률 조정이 성능·효율에 직접 영향을 준다.
인코더-프리 구조(Encoder-Free)
전통적 별도 비전·오디오 인코더를 사용하지 않고 원시 패치나 오디오 청크를 바로 LLM 임베딩 공간으로 사영하는 설계로, 인코더 파라미터를 줄이고 메모리 단편화를 완화하는 데 목적이 있다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 02.수집 2026. 07. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.