본문으로 건너뛰기

Gemma 4 업데이트

Gemma 4는 prefill 25–70% 가속과 최대 31% 낮은 첫 토큰 지연, 도구 호출·프롬프트·컨티뉴이션 처리 개선과 31B 벤치에서 최대 +10.1% 향상이 보고되었다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Gemma 4 업데이트는 prefill 단계 최적화와 채팅 포맷·프롬프트·도구 호출 처리 로직의 수정으로 응답 초기 지연과 출력 일관성을 개선한 발표이다. 문서에는 prefill 25–70% 가속과 첫 토큰 시간 최대 31% 감소, 내부 처리 규칙 회복과 중복 태그 제거 같은 구체적 변경이 명시되어 있으며 Vision 설정의 기본값 max_soft_tokens=280과 1120에서의 OCR 개선 가능성도 함께 제시되었다. 하드웨어·런타임 관련으로는 Flash Attention 4의 Hopper GPU 지원과 NVFP4 양자화를 통한 Blackwell 상 1.5배 추론 속도 향상, GGUF·MLX·NVFP4 템플릿의 재배포 권고가 포함되어 있어 실제 배포 환경에서는 템플릿 교체와 재현 테스트가 필요하다.

실용적 조언

  • GGUF, MLX, NVFP4용 템플릿은 공지된 업데이트를 받아서 재배포해야 하며 템플릿 변경 전후의 엔드투엔드 재현 테스트를 준비해야 한다.
  • Vision 관련 설정으로는 기본 max_soft_tokens 값을 280으로 유지하되 OCR 품질이 더 필요하면 1120 설정의 효과를 실험적으로 검증해야 한다.
  • NVFP4 양자화 사용 시 Blackwell 같은 대상 런타임에서 추론 속도 향상(이미지상 1.5x)을 확인했으므로, 성능 우선 환경에서는 해당 quant 템플릿을 우선 적용하고 정확도 회귀 검증을 병행해야 한다.

섹션별 상세

01
Gemma 4의 전반적 성능 개선은 prefill 단계의 처리 방식을 변경하고 I/O 및 토큰화 파이프라인을 최적화한 결과로 제시되었다. 이미지에는 prefill이 25–70% 더 빠르고 첫 토큰까지의 지연이 최대 31% 낮아졌다는 수치가 명시되어 있으며, 이는 대화형 서비스에서 초기 응답성 개선을 의미한다. 이러한 개선은 입력 검증과 null 처리, 누락된 턴 태그 정정 같은 채팅 포맷 처리 로직의 수정과 맞물려서 실사용 지연을 줄이는 방식으로 작동한다. 따라서 긴 컨텍스트를 다루는 챗봇에서 응답 시작 시간이 단축되고 전체 대화 처리량이 증가할 가능성이 있다.
02
도구 호출 관련 개선은 호출 후 어시스턴트 턴 복원과 'thinking' 큐의 렌더링 방식을 수정한 점이 핵심이다. 원문에는 도구 호출 정확성·일관성·턴 종료 처리 개선이 명시되었고, 연속성 문제로 중복된 <turn> 태그와 불필요한 개행이 제거되었다고 적혀 있다. 이 변경은 호출 결과를 받은 뒤 모델이 어떻게 상태를 갱신하고 다음 출력을 구성하는지의 내부 흐름을 바로잡아 호출 기반 에이전트의 응답 품질을 높인다. 실무적으로는 외부 API 호출 후 대화 맥락이 유실되던 오류가 줄어들고 도구 의존적 워크플로의 안정성이 향상될 것으로 보인다.
03
프롬프트와 컨버세이션 관련 변경은 이전의 generation-prompt 회귀를 되돌리고 역사적 턴 처리와 thought primer 제거 등 문맥 유지와 렌더링 규칙을 조정한 결과이다. 이미지에는 prompts가 회귀에서 복구되었다는 문구와 Conv 관련 APC thought primer 제거가 명시되어 있어, 내부 system이나 priming 토큰이 출력에 어떻게 반영되는지를 제어하는 규칙이 수정되었음이 확인된다. 이러한 수정은 과거 대화 턴을 재현하는 방식과 체인 오브 사고(chain-of-thought) 표기의 보존/표출 방식을 직접 바꿔, 일관된 대화 히스토리 표현과 예측 가능한 출력 포맷을 확보한다. 따라서 프롬프트 설계와 오래된 대화 이력을 사용하는 애플리케이션에서 응답의 안정성이 개선될 가능성이 높다.
04
추론 및 배포 관련으로는 FA4 지원과 템플릿 업데이트, 양자화 템플릿 재배포 권고가 핵심적으로 제시되었다. 원문에 FA4가 NVIDIA Hopper GPU에서 지원된다고 표기되어 하드웨어 수준의 연산 가속과 함께 NVFP4 quant 템플릿이 Blackwell에서 1.5배 빠른 추론을 제공한다는 근거가 제시되었다. 또한 GGUF·MLX·NVFP4용 템플릿을 다시 다운로드하거나 업데이트하라는 안내가 있어 배포 포맷과 런타임 최적화가 성능 차이에 직접 영향을 준다는 점이 드러난다. 결과적으로 모델을 운용하는 인프라에서 양자화 포맷과 어텐션 최적화 채택 여부가 추론 성능과 비용에 실질적 차이를 만들 것으로 보인다.

이미지 분석

Gemma 4의 업데이트 항목 목록과 31B 모델의 벤치마크 결과를 포함한 인포그래픽으로, 성능 수치와 기능 수정 내역이 함께 제시되어 있다.
Infographic

상단에는 prefill 가속, 채팅 포맷 수정, thinking 렌더링 개선, 도구 호출과 출력 복원 등 구체적인 변경 항목들이 나열되어 있으며 각 항목이 어떻게 입력 처리와 출력 렌더링에 영향을 주는지 기술적 키워드로 표기되어 있다. 하단에는 BFCL, TB2, Tau2(Retail/Airline/Telecom) 등 벤치마크 막대그래프가 있으며 각 케이스별로 이전 대비 개선치(+0.40%, +4.50%, +3.10%, +2.00%, +10.10%)와 절대치 비율이 함께 표시되어 있어 수치 기반 비교가 가능하다.

Gemma 4의 업데이트 항목 목록과 31B 모델의 벤치마크 결과를 포함한 인포그래픽으로, 성능 수치와 기능 수정 내역이 함께 제시되어 있다.

위와 동일한 Gemma 4 업데이트 인포그래픽의 다른 해상도 버전으로, 동일한 내용과 수치가 포함되어 있다.
Infographic

이미지 원본과 동일하게 상단의 변경 기록과 하단의 벤치마크 결과를 시각화하여 배포자와 운영자가 즉시 확인해야 할 수정 항목과 성능 변화를 동시에 전달한다. 두 이미지가 같은 정보를 반복 제공하므로 원문 정보의 신뢰성을 높이지만, 실제 적용 전에는 환경별 재현 테스트가 필요함을 시사한다.

위와 동일한 Gemma 4 업데이트 인포그래픽의 다른 해상도 버전으로, 동일한 내용과 수치가 포함되어 있다.

용어 해설

Flash Attention 4
Flash Attention 4는 어텐션 연산의 메모리 접근 패턴과 연산 효율을 개선한 연산 최적화 기술로, GPU의 메모리 대역폭과 연산 병렬성을 더 효율적으로 사용하여 대형 모델의 추론 속도를 높인다. 이 기술은 특히 NVIDIA Hopper 아키텍처 같은 최신 GPU에서 높은 처리량과 낮은 지연을 얻을 수 있게 하며, 동일한 하드웨어에서 더 큰 배치나 더 긴 컨텍스트를 처리할 수 있게 한다. Gemma 4 업데이트 문맥에서는 FA4가 Hopper GPU 상의 추론 가속과 연관되어 소개되었다.
GGUF
GGUF는 모델 가중치와 메타데이터를 저장하는 경량 직렬화 형식으로, 다양한 양자화(quants) 도구들이 호환 가능한 템플릿을 제공할 때 사용되는 파일 포맷이다. 이 형식은 런타임별 로딩 최적화와 호환성 관리를 단순화하여 모델 배포와 추론 환경 전환을 쉽게 한다. 이미지의 안내문은 GGUF 템플릿을 다시 받거나 업데이트할 것을 권고하여 이 포맷의 템플릿 변화가 성능에 영향을 줄 수 있음을 시사했다.
NVFP4 양자화(NVFP4)
NVFP4는 정밀도와 메모리 사용량을 균형 있게 조절하기 위해 개발된 4비트 유사 부동소수점 양자화 방식으로, NVidia 관련 추론 스택에서 효율적인 실행을 목표로 한다. 이 방식은 모델의 추론 속도를 높이면서 메모리 풋프린트를 줄이며, 특정 하드웨어 상에서 양자화된 모델의 정확도 보존을 위해 추가 튜닝이 필요할 수 있다. 원문은 NVFP4 quant를 통해 Blackwell 상에서 1.5배 빠른 추론이 가능하다고 표기하여 속도 측면의 이점을 강조했다.
도구 호출(Tool calling)
Tool calling은 모델이 외부 함수나 API를 호출해 정보를 얻거나 행동을 수행한 뒤 그 결과를 대화 흐름에 통합하는 상호작용 패턴으로, 호출 정확도와 응답 포맷 일관성이 시스템 전체의 안정성에 직접적인 영향을 미친다. 구현 관점에서는 호출 직후 어시스턴트 턴 복원, 호출 반환값의 적절한 렌더링, 그리고 호출 종료 처리까지 전 과정의 상태 관리가 필요하다. Gemma 4 업데이트는 도구 호출의 정확성, 일관성, 턴 종결 처리가 개선되었다고 명시하여 agentic 워크플로에 영향을 주었다.

언급된 도구

Unsloth중립

NVFP4 quant 템플릿과 관련된 툴/템플릿 배포에 연관된 이름으로 표기되었음

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 20.수집 2026. 07. 20.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.