256토큰 블록 디퓨전으로 고속 멀티모달 텍스트 생성
Gemma 4 26B A4B MoE 기반에서 256토큰 블록 이산 디퓨전을 사용해 이미지·텍스트·비디오 입력을 받아 저지연으로 텍스트를 생성하는 멀티모달 모델이다.
TL;DR
DiffusionGemma는 Google DeepMind가 Gemma 4 26B A4B MoE 아키텍처를 바탕으로 공개한 멀티모달 텍스트 생성 모델이다. 이 모델은 토큰 단위의 순차적 생성 대신 256토큰 길이의 '캔버스'를 병렬로 덴오이징하는 이산 텍스트 디퓨전 방식을 채택해 디코딩 병렬성을 획득하고, 인코더의 prefill로 생성된 KV 캐시를 디코더가 cross-attention으로 참조하는 블록-자율회귀 흐름을 따른다. MoE 희소성(128개 중 8개 활성)과 캔버스 기반 샘플링을 결합해 활성 파라미터를 3.8B 수준으로 유지하면서 총 파라미터는 25.2B에 달하고, 최대 256K 토큰의 장문 컨텍스트와 가변 시각 토큰 예산(70~1120)을 지원한다. 문서에는 H100 FP8 환경의 저배치 설정에서 초당 1100 tokens 이상의 생성 성능과 Entropy-Bounded Denoising(최대 48 스텝, 온도 0.8→0.4, 엔트로피 임계치 등) 권장 샘플링 설정이 명시되어 있으나, 공개 벤치마크에서는 일부 언어·비전 벤치에서 Gemma 4 대비 낮은 점수가 보고되어 성능·품질 트레이드오프가 존재함이 확인된다.
핵심 역량
- 멀티모달 입력(텍스트·이미지·비디오)을 섞어서 받아 텍스트 응답 생성
- 블록(캔버스) 단위의 병렬 디퓨전 샘플링으로 고속 텍스트 디코딩
- 장문 문맥 처리(최대 256K tokens)와 캔버스 기반의 블록-자율회귀 생성
- OCR·문서 파싱·차트 해석·화면 UI 이해 등 시각 데이터 추출
- 내장된 Thinking 모드(내적 추론 단계 출력) 및 function calling 지원
강점
- 저지연 고처리량: H100 FP8 환경에서 저배치 설정으로 초당 1100 tokens 이상 생성(문서상의 수치 근거)
- 장문 컨텍스트: 최대 256K tokens를 지원해 긴 문서·대화의 문맥 유지에 적합함
- 멀티모달 유연성: 이미지·비디오·텍스트를 혼합 입력으로 처리하고 가변 시각 토큰 예산으로 정밀도와 속도 균형을 조정 가능함
- 오픈 라이선스: Apache-2.0으로 공개되어 연구·상업적 사용이 가능함
훈련 방식
Gemma 4 26B A4B MoE 기반에서 이산 텍스트 디퓨전(블록-자율회귀) 방식을 적용했으며, 웹문서·코드·수학·이미지 등 멀티모달 대규모 데이터(컷오프 2025년 1월)를 활용해 사전학습했다.
알아두면 좋은 것
- 권장 샘플링: Entropy-Bounded Denoising + Adaptive Stopping, 최대 denoising steps=48, 온도 선형 감쇠 0.8→0.4, 엔트로피 경계 0.1 및 조기 종료 기준(평균 엔트로피 <0.005 및 예측이 2스텝 연속 동일)
- 시각 입력은 가변 해상도와 토큰 예산(70,140,280,560,1120)을 지원해 OCR/문서 파싱에는 높은 시각 토큰 예산을 권장
- 생성 단위: 캔버스 길이 256토큰, 슬라이딩 윈도우 1024토큰, 최대 컨텍스트 길이 Up to 256K tokens로 장문 컨텍스트 처리 가능
- 오픈 소스·라이선스: Apache-2.0 라이선스의 오픈 웨이트 모델로 제공
기술적 특징
- 블록 기반 이산 텍스트 디퓨전(캔버스 샘플링)을 사용해 256토큰 단위로 다중 단계 덴오이징을 수행한다. 완성된 캔버스는 encoder의 prefill을 통해 KV 캐시에 추가되고 이후 블록 생성에서 cross-attention으로 참조되며, 이 과정이 토큰-단위 autoregression보다 높은 병렬성과 처리량을 제공한다.
- Encoder-Decoder 설계를 채택해 인코더는 프리필로 프롬프트를 처리해 KV 캐시를 생성하고 디코더는 캔버스에 대해 bidirectional attention을 적용한다. 이 구성은 컨텍스트를 캐시해 재사용하면서도 블록 단위의 bidirectional 계산을 허용해 캔버스 내 토큰 관계를 효율적으로 모델링한다.
- 희소 MoE 아키텍처(총 128개 전문가 중 8개 활성)를 사용해 전체 파라미터 규모는 크지만 활성 파라미터는 3.8B 수준으로 유지한다. 이로 인해 추론 시 메모리 부담을 낮춰 단일 가속기 환경에서의 실행 가능성을 높이면서도 복잡한 추론 능력을 유지한다.
- 샘플러는 Entropy-Bounded Denoising과 Adaptive Stopping을 적용해 최대 48 스텝 내에서 온도 스케줄(0.8→0.4)과 엔트로피 기반 토큰 선택을 사용한다. 이는 작업 난이도에 따라 덴오이징 스텝을 동적으로 줄여 속도와 품질을 균형시키는 메커니즘이다.
- 추론 최적화는 소수 배치(low batch) 단일 가속기 환경을 목표로 설계되었고, 시각 입력은 토큰 예산(70~1120)을 통해 세밀도·연산량을 제어할 수 있어 OCR·문서 파싱 등 정밀 작업과 일반 분류·캡션 작업 간 트레이드오프를 조절한다.
차별점
- 블록-자율회귀의 이산 텍스트 디퓨전(캔버스 샘플링)으로 캔버스 단위 병렬 덴오이징을 수행해 토큰/초 처리량을 높인 점
- 희소 MoE(128개 중 8개 활성)로 활성 파라미터를 줄여 단일 가속기에서의 저메모리 추론을 염두에 둔 설계
- 인코더의 prefill KV 캐시 + 디코더의 캔버스 내 bidirectional attention 조합으로 긴 컨텍스트와 블록 생성 간 효율적 상호작용을 구현
- 가변 시각 토큰 예산(70~1120)으로 작업별 시각 해상도와 연산량을 명시적으로 조정할 수 있음
- 내장된 Thinking 모드 및 system role 업데이트 지원으로 제어 가능한 단계적 추론 흐름을 제공
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU Pro | accuracy | 77.6% | vs Gemma 4: 82.6% |
| AIME 2026 no tools | accuracy | 69.1% | vs Gemma 4: 88.3% |
| LiveCodeBench v6 | accuracy | 69.1% | vs Gemma 4: 77.1% |
| Codeforces ELO | ELO | 1429 | vs Gemma 4: 1718 |
| GPQA Diamond | accuracy | 73.2% | vs Gemma 4: 82.3% |
| Tau2 (average over 3) | accuracy | 56.2% | vs Gemma 4: 68.2% |
| HLE no tools | score | 11.0% | vs Gemma 4: 8.7% |
| HLE with search | score | 11.9% | vs Gemma 4: 17.2% |
| BigBench Extra Hard | accuracy |
1.1k
Likes
1.2M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.