본문으로 건너뛰기
r/LocalLLaMA조회 2

Gemma 3 270M을 드래프트 모델로 사용하여 Gemma 4 31B 추론 속도 11% 향상

Gemma 3 270M을 드래프트 모델로 활용해 Gemma 4 31B의 생성 속도를 32.9 t/s에서 36.6 t/s로 약 11% 개선했다.

커뮤니티 반응

작성자가 공유한 구체적인 벤치마크 수치와 실행 명령에 대해 긍정적인 반응이 예상되며, 최신 Gemma 모델 조합의 효율성에 주목하고 있다.

주요 논점

01찬성다수

Gemma 3 270M을 드래프트 모델로 사용하는 것이 Gemma 4 31B의 추론 성능 개선에 실질적인 도움이 된다.

합의점 vs 논쟁점

합의점

  • Speculative Decoding은 단일 GPU 환경에서도 유의미한 속도 향상을 제공한다.
  • Gemma 3 270M은 상위 모델을 위한 효율적인 드래프트 모델 역할을 수행할 수 있다.

실용적 조언

  • llama.cpp 사용 시 --hfd 옵션으로 작은 모델을 드래프트로 지정하여 생성 속도를 높일 수 있다.
  • RTX 3090과 같은 소비자용 GPU에서도 31B 규모의 모델을 36 t/s 이상의 속도로 구동 가능하다.

섹션별 상세

작성자는 Gemma 4 31B 모델의 추론 속도를 높이기 위해 훨씬 작은 Gemma 3 270M 모델을 드래프트 모델로 설정했다. llama-cli의 -hfd 옵션을 통해 드래프트 모델을 지정하고 -hf로 메인 모델을 로드하여 Speculative Decoding을 실행하는 방식이다. RTX 3090 GPU에서 실행된 이 설정은 더 큰 모델의 토큰 생성을 작은 모델이 미리 예측하게 하여 전체 연산량을 줄인다.
bash
./build/bin/llama-cli -hf unsloth/gemma-4-31B-it-GGUF:Q4_1 --jinja --temp 1.0 --top-p 0.95 --top-k 64 -ngl 1000 -st -f prompt.txt --no-mmproj -hfd unsloth/gemma-3-270m-it-GGUF:Q8_0

llama-cli를 사용하여 Gemma 4 31B 모델에 Gemma 3 270M 드래프트 모델을 적용하는 실행 명령 예시

실험 결과 드래프트 모델을 사용하지 않았을 때의 32.9 t/s 대비 사용 시 36.6 t/s로 약 11.2%의 속도 향상이 관찰됐다. 프롬프트 처리 속도는 약 610 t/s 수준으로 비슷하게 유지되었으나 실제 텍스트 생성 단계에서 유의미한 효율 개선이 확인됐다. 이는 단일 GPU 환경에서도 Speculative Decoding이 실질적인 성능 이득을 줄 수 있음을 보여준다.
드래프트 모델의 예측이 메인 모델에 의해 수용되는 비율인 Draft Acceptance Rate는 약 0.44(44%)로 기록됐다. 총 1863개의 생성 시도 중 820개가 수용되었으며 이는 두 모델 간의 아키텍처적 유사성이 예측 성공률에 기여했음을 시사한다. 수용률이 높을수록 메인 모델의 검증 횟수가 줄어들어 전체 추론 속도가 더욱 빨라진다.

용어 해설

추측 디코딩(Speculative Decoding)
상대적으로 가벼운 드래프트 모델이 다음 토큰을 미리 예측하고, 메인 모델이 이를 한꺼번에 검증하여 추론 속도를 높이는 기법이다. 예측이 맞을 경우 여러 토큰을 한 번에 생성할 수 있어 전체적인 생성 속도가 향상된다.
드래프트 모델(Draft Model)
추측 디코딩에서 메인 모델 대신 다음 토큰을 빠르게 제안하는 역할을 수행하는 소규모 언어 모델이다. 메인 모델과 아키텍처가 유사할수록 예측 성공률이 높아지며 전체 시스템의 효율성을 결정짓는 핵심 요소이다.
수용률(Acceptance Rate)
드래프트 모델이 제안한 토큰을 메인 모델이 실제로 채택한 비율을 의미한다. 이 수치가 높을수록 드래프트 모델의 예측이 정확하다는 뜻이며, 추론 속도 개선 효과와 직결되는 성능 지표이다.
GGUF
llama.cpp 등에서 널리 사용되는 대규모 언어 모델 저장 형식으로, CPU와 GPU 간의 효율적인 텐서 로딩을 지원한다. 양자화된 모델을 배포하고 로컬 환경에서 실행하는 데 최적화되어 있다.

언급된 도구

llama-cli추천

llama.cpp 기반의 LLM 추론 실행 도구

unsloth추천

최적화된 GGUF 모델 제공 및 학습 라이브러리

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 04.수집 2026. 04. 04.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.