본문으로 건너뛰기

Gemma 4 성능 급등과 훈련 데이터 불투명성

Gemma 4는 소폭의 파라미터 증가와 지시문 데이터 조정으로 벤치마크에서 크게 향상했으나 사전학습 데이터 세부는 공개하지 않았다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Gemma 4는 파라미터를 27B에서 31B로 소폭 늘리는 대신 지시문 튜닝의 데이터 혼합과 thinking mode 같은 구성 변경으로 여러 벤치에서 큰 성능 향상을 보고했습니다. 핵심 문제는 사전학습 토큰 수와 데이터 혼합 비율이 보고서에 제공되지 않아 성능 향상의 근거를 외부에서 검증할 수 없다는 점입니다. 파인튜닝은 상대적으로 적은 하드웨어로 가능하지만 데이터 품질과 구성에 따라 안전성 손상이 발생할 수 있으므로, 실무 팀은 자체 라벨링·평가 파이프라인과 멀티모달 안전 검증을 준비해야 합니다.

섹션별 상세

Google DeepMind의 Gemma 4는 2026년 4월에 가중치를 공개하고 7월 기술 보고서를 냈으며, 핵심 결과는 적은 파라미터 증분(27B→31B)에도 불구하고 여러 벤치마크에서 대규모 향상을 보였다는 점입니다. 보고서 본문은 생각 모드(thinking mode)와 지시문 튜닝에서의 데이터 혼합 변경을 주요 원인으로 지목하고 있으나 사전학습 토큰 수와 혼합 비율 같은 핵심 데이터 메트릭은 공개하지 않았습니다. 이 불일치는 모델의 성능 향상을 설명하는 주장과 그 근거인 데이터의 투명성 사이에 간극을 만듭니다.
벤치마크 수치가 보여주는 변화는 극적입니다. 예컨대 AIME 2026 점수가 20.8에서 89.2로, Codeforces Elo가 110에서 2150으로 상승했고 τ²-bench의 telecom 점수가 3.1에서 69.3으로 올랐습니다. 그러나 보고서에 제시된 모든 수치는 Google 자체 평가에 기반하며, 일부 지표는 thinking mode 활성화나 시각 토큰 해상도 같은 구성 파라미터에 민감해 배포 환경과 일대일 비교가 되지 않을 가능성이 큽니다.
근거
  • AIME 2026 점수가 Gemma 3 27B 대비 20.8에서 89.2로 상승했다. 기술 보고서의 벤치마크 표에 기재된 AIME 2026 점수 비교(수치 표). 출처
구조적 변경은 세 가지 핵심 축에서 이뤄졌습니다. 모델은 thinking mode를 도입해 응답 전에 추론 출력을 생성할 수 있고, 장문 처리 효율을 위해 지역 슬라이딩 윈도우와 글로벌 어텐션 비율(5:1)·p-RoPE·KV 캐시 공유를 결합해 글로벌 KV 캐시를 37.5% 줄였으며, 12B 모델은 별도 인코더를 버리고 이미지와 오디오를 직접 임베딩으로 투사하는 설계를 채택했습니다. 이러한 설계는 지연·메모리·해상도 선택에 따라 성능이 달라지므로 적용 시 구성 결정을 반드시 검증해야 합니다.
근거
  • 지시문 튜닝에 특정한 데이터 하위집합(귀속, 헤징, 거절)을 포함시키자 사실성 지표가 개선되었고 다른 지표에서는 성능 저하가 관찰되지 않았다. 기술 보고서의 지시문 튜닝 섹션에서 데이터 필터링과 하위집합 효과를 기술한 단락과 측정 결과 표. 출처
파인튜닝은 비교적 적은 하드웨어 장벽으로도 실행 가능하지만 데이터 품질과 구성이 결정적입니다. 공개된 벤더 문서에 따르면 LoRA나 QLoRA로 E2B는 8–10GB, E4B는 17GB, 31B는 약 22GB VRAM에서 파인튜닝이 가능하며 MoE 변종은 더 많은 메모리를 요구합니다. 그러나 연구들은 좁은 범위의 파인튜닝이 안전성 정렬을 훼손할 수 있고 어댑터 용량(rank)에 따라 손상이 커지는 경향을 보였다고 보고해, 파인튜닝 데이터의 엄격한 품질 관리와 평가가 필수적임을 시사합니다.
안전성 측면에서 보고서는 비필터 상태의 광범위한 안전성 평가를 실어 두었으나 별도 파인튜닝 후에는 안전성 악화가 발생할 수 있다는 외부 연구 결과가 인용됩니다. 텍스트 전용 안전 평가만으로는 멀티모달 파인튜닝에서 발생할 문제를 과소평가할 수 있고, 안전성 회복을 위해서는 지시문 튜닝 혼합에 수백 개 수준의 안전 예제를 주입하는 등 데이터 구성 중심의 완화 전략이 보고서와 관련 문헌에서 반복적으로 제안됩니다. 따라서 파인튜닝 전후의 안전성 평가는 배포하려는 모든 모달리티를 포함해야 합니다.
근거
  • 좁은 범위의 파인튜닝은 안전성 정렬을 약화시키며 LoRA rank가 클수록 손상이 커진다. 2026년 프리프린트 연구 결과를 인용한 단락과 해당 arXiv 링크. 출처
실무적 결론은 모델을 '상품'으로 보고 자신의 라벨 데이터와 평가 기반을 핵심 자산으로 삼으라는 점입니다. Gemma 4 보고서가 데이터 구성 차이를 성능 향상의 주요 메커니즘으로 지목하면서도 사전학습 데이터의 세부를 공개하지 않았으므로, 외부 팀은 사전학습 상태를 검증할 수 없고 오로지 자신이 준비한 파인튜닝 혼합과 평가로 책임을 져야 합니다. 규제적 맥락에서도 Article 53(1)(d)와 같이 훈련 데이터 요약 공개 요구가 강화되고 있으니, 문서화 가능한 데이터 파이프라인과 감사 증적을 마련하는 것이 중요합니다.
근거
  • 사전학습 토큰 수와 모델별 토큰 예산이 Gemma 4 보고서에는 공개되지 않았다. §2.4의 데이터 섹션이 범주와 컷오프만 명시하고 토큰 수를 누락한 부분을 지적한 본문 지적. 출처

용어 해설

추론 트레이스 모드(Thinking mode)
모델이 최종 답변을 내기 전에 단계별 추론(추론 트레이스)을 먼저 출력하도록 하는 동작 방식으로, 추론 중간 결과를 토큰으로 생성해 출력 지연과 토큰 비용을 발생시키는 대신 더 긴 추론 흐름을 모델 내부적으로 활성화해 정확도와 일관성을 높이려는 목적을 가진다.
지시문 튜닝(Instruction-tuning)
사전학습된 모델을 사람 작성 예제나 정제된 지시-응답 쌍으로 추가 학습시켜 사용자 지시를 더 잘 따르게 만드는 사후 학습 단계로, 데이터 혼합 구성과 레이블 품질이 모델의 사실성·거절·정밀도 행동에 직접적인 영향을 미친다.
LoRA
Low-Rank Adapters 방식으로, 전체 가중치를 미세조정하지 않고 저순위 분해 행렬을 추가로 학습해 파라미터·메모리 비용을 절감하는 파인튜닝 기법으로, 어댑터 용량(rank)이 커질수록 안전성 손상 위험이 증가할 수 있다.
QLoRA
저정밀화(quantization)된 가중치를 기반으로 LoRA 스타일의 어댑터를 결합해 더 적은 VRAM으로 대형 모델을 파인튜닝하는 방식으로, 실무에서 31B급 모델을 22GB VRAM 환경에서 튜닝하는 사례가 보고되어 있다.
양자화 인식 학습 체크포인트(Quantization-aware-trained checkpoints)
모델을 학습할 때 양자화 영향을 고려해 가중치를 조정한 체크포인트로, 배포 시 메모리 사용량을 크게 줄이면서도 성능 저하를 최소화하려는 목적으로 사용되며 Gemma 4 리포트는 이 형식의 체크포인트를 함께 제공한다고 명시한다.

기술

  • Gemma 4는 2.3B, 4.5B, 12B, 31B의 dense 모델과 26B-A4B MoE 변종으로 구성되며 Apache 2.0 라이선스로 제공됩니다. 256k 토큰 컨텍스트를 지원하고 양자화 인식(quantization-aware) 체크포인트를 함께 배포한다고 기술 보고서가 명시합니다. 이 조합은 다운로드·재배포는 허용하나 학습 코드와 원시 훈련 데이터는 공개되지 않아 재현성에는 제한이 있습니다.
  • 토크나이저로는 SentencePiece를 사용하며 숫자 분리, 공백 보존, 바이트 수준 인코딩을 포함하는 262k 어휘로 구성되어 있습니다. 이 토크나이저 설정은 텍스트 분할 방식과 입력 길이 처리에 직접적으로 영향을 주며, 토큰 기반 비용·컨텍스트 분할 설계에 영향을 미칩니다. 다만 토크나이저 정보만으로는 훈련 코퍼스의 성격을 판단할 수 없습니다.
  • 파인튜닝 관련으로 보고서는 SFT, LoRA, QLoRA, DPO, RLHF 등 다양한 방법을 지원한다고 명시합니다. 벤더 문서(예: Unsloth)는 각 모델 크기별 VRAM 요구량과 QLoRA 적용 시 메모리 감소 수치를 제시해 실제 파인튜닝 가능성을 보여줍니다. 그러나 연구들에서는 어댑터 용량과 데이터 구성에 따라 안전성 손상이 발생할 수 있음이 관찰되었습니다.
  • 장문·멀티모달 처리 관련 기술은 지역 슬라이딩 윈도우와 글로벌 어텐션 비율(5:1), p-RoPE와 KV 캐시 공유를 결합해 전역 KV 캐시를 약 37.5% 절감하는 방식으로 소개됩니다. 12B 모델은 별도 비전·오디오 인코더를 버리고 원시 패치를 35M 파라미터 투사층으로 직접 임베딩하는 설계 변경을 적용해 모달리티 처리 파이프라인을 단순화했습니다. 이러한 설계 선택은 해상도·지연·메모리 트레이드오프에 민감합니다.

활용 사례

  • 기업용 멀티모달 어시스턴트에서의 정책 준수·도구 사용 검증용으로 Gemma 4의 τ²-bench 성과는 유의미한 신호를 제공합니다. τ²-bench는 도메인 정책을 따르는지, 도구를 가진 사용자와 상호작용하면서 공유 상태를 올바르게 수정하는지를 데이터베이스 상태로 검증하기 때문에 엔터프라이즈 에이전트 평가와 유사한 요구를 반영합니다. 다만 보고서의 점수는 어느 pass 메트릭을 썼는지 명시되어 있지 않아 직접 재검증이 필요합니다.
  • 문서 이해·시각 질문응답(InfographicVQA, OmniDocBench) 작업에서는 입력 해상도와 비전 토큰 수가 성능에 큰 영향을 미칩니다. Gemma 4 메인 표는 1120 비전 토큰 구성에서의 성능을 제시하는 반면, 280 토큰으로 축소하면 12B 모델의 성능이 크게 떨어지는 사례가 있어 배포 시 처리량 대 품질의 트레이드오프를 명확히 해야 합니다. 따라서 문서·인포그래픽 처리용 서비스는 해상도 설정을 사전 검증해야 합니다.
  • 경쟁 프로그래밍·콘테스트 코드 생성처럼 단발성 문제 해결에서는 Codeforces Elo 같은 수치가 헤드라인성이 크지만 실무 유지보수 코드 신뢰도에는 약한 신호를 제공합니다. 실전 코드를 생성·배포하는 경우에는 LiveCodeBench·Terminal Bench 같은 더 현실적인 평가지표를 자체 데이터로 실행해 안정성과 반복성(pass^k)을 확인해야 합니다. 단회 성과가 반복 가능한 성능으로 이어지는지 반드시 점검해야 합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 06.수집 2026. 08. 06.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.