섹션별 상세
기존 LLM은 토큰을 왼쪽에서 오른쪽으로 하나씩 생성하는 자기회귀(autoregressive) 방식을 사용하지만, DiffusionGemma는 이미지 생성 모델의 확산 기법을 차용해 텍스트를 병렬로 생성한다.
모델은 플레이스홀더 토큰을 캔버스에 배치하고 여러 번의 정제 과정을 거쳐 최종 텍스트 블록을 완성하는 방식으로 작동한다.
260억 개의 파라미터를 가진 Mixture of Experts(MoE) 구조를 채택했으며, 추론 시에는 38억 개의 파라미터만 활성화되어 메모리 효율성을 높였다.
RTX 5090에서 초당 약 700 토큰, H100에서 초당 1,000 토큰 이상의 처리량을 보이며, 이는 동급 크기의 기존 Gemma 모델보다 4배 빠른 속도이다.
근거
- DiffusionGemma는 동급 크기의 기존 Gemma 모델보다 4배 빠른 속도이다. — 본문 마지막 문단
기술
- DiffusionGemma
- Gemma
- MoE
- Nvidia RTX 5090
- Nvidia H100
활용 사례
- 고속 텍스트 생성
- 로컬 LLM 추론
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 11.수집 2026. 06. 11.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
