실용적 조언
- AMD GPU 사용자라면 FLASH_ATTENTION_TRITON_AMD_ENABLE 옵션을 활성화하여 성능을 개선할 수 있다.
- Qwen 3.5 서빙 시 speculative-config를 통해 MTP 기능을 활성화하면 처리량을 극대화할 수 있다.
섹션별 상세
Qwen 3.5 27B AWQ 모델은 vLLM 환경에서 초당 39.08개의 출력 토큰 처리량을 달성했다. MTP(Multi-Token Prediction) 5 설정을 통해 89.7%의 높은 투기적 디코딩 수락률을 기록하며 추론 효율을 극대화했다. 벤치마크 결과 평균 TTFT는 24.7초, TPOT는 49.2ms로 측정되어 전반적으로 빠른 응답성을 보였다. 이는 모델 아키텍처와 양자화 방식의 조합이 성능 향상에 기여한 결과이다.
bash
docker run -it --name vllm-gfx906-mobydick -v ~/llm/models:/models --network host --device=/dev/kfd --device=/dev/dri --group-add video --group-add $(getent group render | cut -d: -f3) --ipc=host aiinfos/vllm-gfx906-mobydick:latest FLASH_ATTENTION_TRITON_AMD_ENABLE="TRUE" OMP_NUM_THREADS=4 VLLM_LOGGING_LEVEL=DEBUG vllm serve \
/models/Qwen3.5-27B-AWQ \
--served-model-name Qwen3.5-27B-AWQ \
--dtype float16 \
--enable-log-requests \
--enable-log-outputs \
--log-error-stack \
--max-model-len auto \
--gpu-memory-utilization 0.98 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder \
--reasoning-parser qwen3 \
--speculative-config '{"method":"qwen3_next_mtp","num_speculative_tokens":5}' \
--mm-processor-cache-gb 1 \
--limit-mm-per-prompt.image 1 --limit-mm-per-prompt.video 1 --skip-mm-profiling \
--tensor-parallel-size 4 \
--host 0.0.0.0 \
--port 8000 2>&1 | tee log.txtAMD GPU 환경에서 Qwen 3.5 27B AWQ 모델을 MTP 설정과 함께 서빙하기 위한 Docker 실행 명령어
Gemma 4 31B it AWQ 모델은 동일한 환경에서 초당 18.77개의 출력 토큰 처리량을 기록했다. Qwen 3.5와 비교했을 때 평균 TTFT가 42.8초로 약 73% 더 길게 나타났으며, TPOT 또한 127.2ms로 상대적으로 느린 추론 속도를 보였다. 4비트 AWQ 양자화를 적용했음에도 불구하고 모델 크기와 아키텍처 차이로 인해 처리량 면에서 한계를 드러냈다.
Qwen 3.5는 MTP 아키텍처 덕분에 Gemma 4보다 수치상 속도 우위를 점했다. 하지만 Qwen 3.5는 Gemma 4보다 더 많은 '사고 토큰(thinking tokens)'을 생성하는 특성이 있어 전체 응답 완료 시간은 사용 사례에 따라 더 길어질 가능성이 존재한다. 실제 에이전트 활용 사례(Agentic use cases)에서는 Qwen 3.5가 Gemma 4보다 약간 더 나은 성능을 보인다는 실무적 평가가 제시됐다.
AMD gfx906 하드웨어에서 vLLM 포크 버전을 사용하여 Docker 컨테이너 기반의 추론 환경을 구축했다. FLASH_ATTENTION_TRITON_AMD_ENABLE 옵션을 활성화하여 AMD GPU에서의 연산 효율을 높였으며, 텐서 병렬화(Tensor Parallel) 크기를 모델에 따라 2 또는 4로 설정했다. 이러한 설정은 로컬 환경에서 대규모 언어 모델을 효율적으로 서빙하기 위한 구체적인 재현 경로를 제공한다.
용어 해설
- vLLM
- — LLM 추론 및 서빙을 위한 고성능 라이브러리이다. PagedAttention 기술을 통해 KV 캐시 메모리 효율을 극대화하여 대규모 모델의 처리량을 높이는 데 핵심적인 역할을 한다.
- 활성화 기반 가중치 양자화(AWQ)
- — Activation-aware Weight Quantization의 약자로, 모델의 가중치를 4비트 등으로 압축하면서도 성능 저하를 최소화하는 기법이다. 메모리 사용량을 줄여 로컬 하드웨어에서의 추론을 가능하게 한다.
- 첫 토큰 생성 시간(TTFT)
- — Time to First Token의 약자로, 사용자의 입력 요청 후 모델이 첫 번째 응답 토큰을 출력할 때까지 걸리는 지연 시간이다. 실시간 상호작용의 쾌적함을 결정하는 지표이다.
- 투기적 디코딩(Speculative Decoding)
- — 작고 빠른 초안 모델이 여러 토큰을 먼저 생성하고 큰 모델이 이를 한 번에 검증하는 방식이다. 검증 성공 시 한 번의 추론 단계에서 여러 토큰을 확정할 수 있어 속도가 향상된다.
- 다중 토큰 예측(MTP)
- — Multi-Token Prediction의 약자로, 모델이 다음 한 개의 토큰이 아닌 여러 개의 토큰을 동시에 예측하도록 학습된 구조이다. 추론 시 투기적 디코딩과 결합하여 처리 속도를 크게 높인다.
언급된 도구
vLLM추천
LLM 추론 및 서빙 엔진
Qwen 3.5 27B추천
대규모 언어 모델
Gemma 4 31B중립
대규모 언어 모델
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 06.수집 2026. 04. 06.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.