섹션별 상세
mpirun -n 1 --oversubscribe python3 run.py --model_dir meta-llama/Llama-3.3-70B-Instruct --tokenizer meta-llama/Llama-3.3-70B-Instruct --draft_model_dir yuhuili/EAGLE3-LLaMA3.3-Instruct-70B --dataset speed --dataset_path data/speed/qualitative --tp_size 8 --ep_size 1 --draft_length 3 --output_length 4096 --engine TRTLLM --concurrency 32 --show_progressSPEED-Bench 측정 프레임워크를 사용하여 Llama 3.3 70B 모델과 EAGLE3 드래프트 모델의 투기적 디코딩 성능을 측정하는 실행 예시
용어 해설
- 투기적 디코딩(Speculative Decoding)
- — 가벼운 드래프트 모델이 여러 토큰을 미리 예측(Speculate)하고, 이를 거대 모델(Target Model)이 한 번에 병렬로 검증하여 추론 속도를 높이는 기법이다. 타겟 모델의 출력 분포를 그대로 유지하면서도 추론 지연 시간을 대폭 줄일 수 있어 실시간 서비스 최적화에 필수적이다.
- 수락률(Acceptance Rate)
- — 드래프트 모델이 제안한 토큰 후보들 중 타겟 모델에 의해 최종적으로 채택된 비율을 의미한다. 수락률이 높을수록 드래프트 모델의 예측 정확도가 높다는 뜻이며, 이는 곧 투기적 디코딩을 통한 전체 추론 속도 향상으로 직결된다.
- 입력 시퀀스 길이(Input Sequence Length)
- — 모델에 입력되는 전체 토큰의 개수를 의미하며, ISL이라고도 불린다. 시퀀스 길이에 따라 추론 과정이 연산 중심(Compute-bound)에서 메모리 대역폭 중심(Memory-bound)으로 변화하므로, 실제 운영 환경의 성능을 측정할 때 매우 중요한 변수이다.
- 다중 토큰 예측(Multi-Token Prediction)
- — 모델 학습 시 다음 토큰 하나만 예측하는 대신, 여러 개의 미래 토큰을 동시에 예측하도록 학습시키는 기법이다. 투기적 디코딩에서 별도의 드래프트 모델 없이도 자체적인 예측 헤드(MTP Head)를 통해 높은 수락률을 달성할 수 있게 한다.
- 어휘 사전 가지치기(Vocabulary Pruning)
- — 추론 시 연산량을 줄이기 위해 출력 레이어의 어휘 사전 중 사용 빈도가 낮은 토큰들을 제거하는 최적화 기법이다. 연산 효율은 높아지지만, 다국어나 특수 도메인 같은 롱테일(Long-tail) 데이터에서 예측 정확도가 떨어지는 부작용이 발생할 수 있다.
기술
- TensorRT-LLM
- vLLM
- SGLang
- EAGLE3
- Llama 3.3
- Python
활용 사례
- LLM 추론 가속화
- 실제 서비스 환경 성능 벤치마킹
- 드래프트 모델 성능 검증
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
