Gemma 4 31B, 256K 컨텍스트와 멀티모달 추론 성능
Gemma 4 31B는 이미지와 텍스트 입력을 통합해 최대 256K 토큰 장기 문맥과 고성능 추론을 제공하는 멀티모달 대형언어모델이다.
TL;DR
Gemma 4 31B는 Google DeepMind가 공개한 멀티모달 Gemma 4 계열의 31B 크기 instruction-tuned 모델로 이미지와 텍스트 입력을 결합해 텍스트 출력을 생성하는 데 최적화되어 있다. 모델은 로컬 슬라이딩 윈도우와 글로벌 어텐션을 혼합한 하이브리드 어텐션, 글로벌 레이어의 통일된 K/V와 p-RoPE를 통해 최대 256K 토큰의 장기 컨텍스트를 효율적으로 처리하며 MoE 변형은 활성 파라미터를 줄여 대형 모델의 추론 비용을 낮춘다. 비주얼 토큰 예산과 Per-Layer Embeddings 같은 설계로 이미지 해상도·연산 비용·온디바이스 배포 요구를 균형 있게 조정할 수 있으며 Apache-2.0 라이선스와 광범위한 문서·샘플 코드를 통해 연구와 상용 적용 모두에 활용 가능하다. 다만 데이터 편향·문맥 복잡성·사실성 한계는 남아 있어 안전 평가와 지속적 모니터링이 필요하다.
핵심 역량
- 이미지 이해와 텍스트 생성 능력을 결합해 이미지 캡셔닝, 문서 OCR, 차트·표 해석 등 시각 정보 추출 작업을 수행할 수 있다. 이미지 입력은 텍스트 앞에 배치하도록 권장하고 가변 비주얼 토큰 예산을 통해 세부정보와 연산 비용을 균형 조절할 수 있다. 멀티모달 입력을 임의 순서로 섞어 넣는 인터리브 형식도 지원한다.
- 매우 긴 문맥을 유지하며 추론할 수 있어 최대 128K 또는 256K 토큰 범위의 장기 의존성 작업을 처리한다. 하이브리드 어텐션(슬라이딩 윈도우 + 글로벌 어텐션)과 글로벌 레이어의 통일된 K/V 및 p-RoPE로 장문 문맥에서 위치 표현 안정성을 확보한다. 이러한 설계는 문맥 유지 비용을 낮추면서도 심층적 추론을 가능하게 한다.
- 모델 군 내에 Dense와 MoE(혼합 전문가) 아키텍처가 공존해 다양한 배포 환경에 적응한다. MoE 변형은 전체 파라미터 대비 일부 전문가만 활성화해 활성 파라미터 수를 줄이고 추론 속도를 개선한다. 이로 인해 동일 총파라미터 대비 빠른 추론과 낮은 비용으로 대화형 에이전트와 실시간 애플리케이션을 지원한다.
- 코드 생성과 함수 호출을 네이티브로 지원하며 'system' 역할과 thinking 모드를 통해 더 구조화된 대화와 단계적 추론을 처리한다. thinking 모드는 내부 추론 출력과 최종 답변을 구분해 출력하도록 설계되어 복잡한 문제 풀이와 에이전트 워크플로에 유리하다. 표준 샘플링 설정(temperature=1.0, top_p=0.95, top_k=64)이 권장된다.
- 작은 모델 변형(E2B, E4B)은 Per-Layer Embeddings와 같은 효율화 기술로 온디바이스 실행을 겨냥해 설계되었다. PLE는 각 디코더 레이어에서 조회 기반 임베딩을 사용해 효과적 파라미터 수를 줄이는 방식을 취한다. 이로 인해 모바일·엣지 환경에서도 실용적인 멀티모달 기능을 제공한다.
강점
- 31B 변형은 다양한 벤치마크에서 높은 성능을 보였으며 MMLU Pro 85.2%, MMMLU 88.4% 등 장문·비전·추론 과제에서 상위권 결과를 기록했다. 이러한 수치는 동일 계열의 더 작은 변형들보다 일관되게 우수한 추론 능력을 반영한다. 벤치마크 표는 모델이 범용 추론과 멀티모달 이해에서 고성능을 갖췄음을 뒷받침한다.
- MoE 변형(26B A4B)은 총 파라미터 25.2B 대비 활성 파라미터 3.8B로 설계되어 평균적인 4B급 모델과 유사한 추론 속도를 제공하면서 대형 모델의 표현력을 유지한다. 이 구조는 대규모 모델이 요구하는 비용과 지연을 줄이며 빠른 서비스 응답을 필요로 하는 애플리케이션에 유용하다. 활성화된 전문가 수와 라우팅 설계가 추론 효율화를 가능하게 한다.
- Gemma 4 계열은 Apache-2.0 라이선스로 공개되어 연구와 상용 활용 양쪽에 규정상 유연성을 제공한다. 모델 리포지토리의 다운로드 수와 좋아요(다운로드 12,203,723회, 좋아요 3,236개)는 개발자 커뮤니티의 높은 관심과 실사용 사례 검증 가능성을 시사한다. 공개 라이선스와 풍부한 문서가 실전 적용을 촉진한다.
훈련 방식
Gemma 4는 대규모 멀티모달 코퍼스(웹 문서, 코드, 이미지, 오디오)를 사용해 사전학습되었고 instruction-tuned 변형을 통해 대화·지시응답 능력을 향상시켰다. 데이터 전처리 단계에서 CSAM 필터링과 민감정보 제거, 품질 기반 필터링을 적용해 학습 데이터의 안전성과 품질을 확보했다. 모델 개발 과정에는 내부 안전팀의 자동·수동 평가가 포함되어 위험 행위 감소와 불필요한 거부율 간 균형을 맞추었다.
알아두면 좋은 것
- Gemma 4 계열은 Dense와 MoE 아키텍처를 모두 제공하며 모델 크기는 E2B, E4B, 12B, 26B A4B, 31B로 구분된다. 작은 변형은 온디바이스 효율화를 위해 설계되었고 중간·대형 변형은 128K~256K의 확장된 문맥을 지원한다. 모든 모델은 멀티모달 입력을 처리하도록 사전설계되어 다양한 배포 시나리오에 대응한다.
- 12B Unified 변형은 전용 비전/오디오 인코더를 제거하고 원시 패치와 파형을 경량 선형층으로 직접 임베딩 공간에 투영하는 통합 구조를 사용한다. 이 방식은 멀티모달 전처리 지연을 줄이고 한 번의 파인튜닝으로 모든 모달리티를 함께 조정할 수 있게 한다. 통합 설계는 멀티모달 레이턴시와 파인튜닝 복잡도를 낮춘다.
- 모델은 가변 비주얼 토큰 예산(70, 140, 280, 560, 1120)을 통해 이미지 표현의 세부 보존 수준과 연산 비용을 조정할 수 있다. 낮은 예산은 분류·캡셔닝과 같은 빠른 처리에 적합하고 높은 예산은 OCR·문서 파싱과 같은 정밀 작업에 적합하다. 또한 오디오 입력은 E2B·E4B·12B 모델에서 기본 지원되며 오디오 최대 길이는 30초, 비디오는 60초(초당 1프레임 처리 가정)까지 권장된다.
기술적 특징
- 하이브리드 어텐션 구조는 로컬 슬라이딩 윈도우 어텐션과 전체 글로벌 어텐션을 교차 적용하되 마지막 레이어는 항상 글로벌 어텐션으로 유지한다. 이 방식은 지역 문맥을 빠르게 처리해 처리 속도와 메모리 사용을 줄이면서도 최종 단계에서 전체 문맥에 대한 전반적 인지를 확보한다. 글로벌 레이어에서는 통일된 Keys/Values와 p-RoPE를 적용해 긴 문맥에서 위치 표현의 일관성을 유지한다.
- MoE 아키텍처(26B A4B)는 총 25.2B 파라미터 중 활성 파라미터를 3.8B로 제한하는 설계로 입력에 따라 일부 전문가만 활성화하는 라우팅을 사용한다. 이로 인해 실제 추론 시 4B급 모델에 근접한 속도로 동작하면서 대형 모델의 표현력을 부분적으로 활용할 수 있다. 전문가 수는 128개(그중 8개 활성, 1개 공유)로 구성되어 있으며 이는 모듈화된 확장성과 비용-성능 균형에 기여한다.
- 12B Unified 변형은 별도 비전/오디오 인코더를 두지 않고 원시 이미지 패치와 오디오 파형을 경량 선형층으로 직접 LLM 임베딩 공간으로 투영하는 통합 아키텍처를 채택했다. 이 설계는 멀티모달 전처리 단계의 레이턴시를 줄이고 전체 모델을 단일 파이프라인에서 파인튜닝할 수 있게 한다. 통합 접근은 멀티모달 파인튜닝의 복잡성을 낮추고 일관된 표현 학습을 가능하게 한다.
- Per-Layer Embeddings(PEL)는 각 디코더 레이어가 토큰별로 자체 임베딩 테이블을 조회하도록 하여 파라미터 효율을 극대화한다. 임베딩 테이블은 조회 전용으로 동작해 전체 모델 깊이를 늘리지 않고도 계층별 표현 다양성을 확보한다. 이 기법은 특히 E2B·E4B처럼 온디바이스 효율이 중요한 변형에서 효과가 크다.
- 비주얼 토큰 예산 메커니즘은 이미지 표현을 토큰 예산으로 정량화해 해상도와 연산 비용 사이를 조정한다. 제공되는 예산 값(70, 140, 280, 560, 1120)은 작업 요구에 따라 세부 정보 보존 수준을 선택하게 해준다. 낮은 예산은 빠른 분류·캡션에 적합하고 높은 예산은 OCR·세밀한 문서 분석에 적합하다.
차별점
- Gemma 4는 하이브리드 어텐션과 p-RoPE를 결합해 최대 256K 토큰의 매우 긴 문맥을 비용 효율적으로 처리하도록 설계되어 장문 추론 작업에서 유리한 구조적 이점을 갖는다. 해당 설계는 로컬 연산의 경량성 유지와 글로벌 정보의 깊은 인지를 동시에 달성한다. 결과적으로 긴 대화 히스토리나 문서 기반 질의응답에서 높은 실용성을 제공한다.
- 26B A4B MoE 변형은 전체 파라미터 규모는 크지만 활성 파라미터만 소수만 동작시키는 구조를 통해 대형 모델의 표현성과 경량 모델의 추론 속도를 동시에 노린다. 이 접근은 대형 모델을 실시간 서비스에 적용할 때 비용-지연 트레이드오프를 크게 개선한다. 개발자는 MoE 변형을 선택해 추론 자원에 맞춘 성능 최적화를 수행할 수 있다.
- 12B Unified 아키텍처는 전용 인코더를 제거하고 원시 멀티모달 입력을 직접 임베딩 공간으로 투영함으로써 멀티모달 레이턴시와 파인튜닝 복잡도를 낮춘다. 이 통합 방식은 멀티모달 파인튜닝을 단일 단계로 수행할 수 있게 해 개발·배포 과정을 단순화한다. 결과적으로 멀티모달 파이프라인의 엔드투엔드 최적화가 용이해진다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU Pro | accuracy | 85.2% | vs Gemma 3 27B: 67.6% |
| AIME 2026 no tools | accuracy | 89.2% | vs Gemma 3 27B: 20.8% |
| LiveCodeBench v6 | accuracy | 80.0% | vs Gemma 3 27B: 29.1% |
| Codeforces ELO | ELO | 2150 | — |
| MMMLU | accuracy | 88.4% | vs Gemma 3 27B: 70.7% |
| MRCR v2 8 needle 128k | accuracy | 66.4% | vs Gemma 3 27B: 13.5% |
3.4k
Likes
12.4M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.