TL;DR
RTX 5060 Ti 16GB에서 Qwen3.8-27B IQ4는 MTP-1과 64K 텍스트 문맥을 함께 사용하면서 짧은 문맥에서 약 45–47 tok/s, 약 55K 토큰 이후 31.3 tok/s를 기록했습니다. Vision은 F16 projector로 동작했지만 VRAM 여유가 136–208 MiB까지 줄어 별도 프로필이 필요했습니다. Unsloth UD-IQ4_XS는 Q8 기준과 가장 가까운 양자화 품질을 보였고, 실제 다중 턴 에이전트 점수에서는 jpetrina 양자화가 40/80으로 38/80의 Unsloth를 근소하게 앞섰습니다. 27B 모델은 단일 함수 호출보다 긴 이력과 의존 도구를 처리하는 상태 유지형 작업에서 Qwen3.5-9B보다 안정적이었습니다.
실용적 조언
- RTX 5060 Ti 16GB에서 Qwen3.8-27B를 긴 문맥 에이전트로 사용할 때는 MTP-1과 64K 텍스트 프로필을 우선 구성하는 편이 적합합니다. 약 55K 토큰 문맥에서는 생성 속도가 31.3 tok/s로 낮아지므로 짧은 문맥의 45–47 tok/s 수치를 긴 작업 전체에 그대로 적용하면 안 됩니다. Vision을 함께 써야 한다면 64K, MTP, F16 projector를 한 번에 고정하지 말고 문맥을 줄인 별도 프로필을 사용하는 편이 VRAM 부족을 피할 수 있습니다.
- 다중 단계 도구 작업이 핵심이면 Perplexity가 가장 낮은 양자화를 자동으로 선택하기보다 실제 워크플로 점수를 별도로 측정해야 합니다. 이 테스트에서는 Unsloth UD-IQ4_XS가 Q8 기준에 더 가까웠지만 jpetrina 양자화가 BFCL 다중 턴에서 40/80으로 38/80의 Unsloth를 앞섰습니다. 따라서 사용할 도구, 승인 흐름, 오류 복구, 긴 이력 검색을 포함한 로컬 시나리오를 직접 재현하는 것이 필요합니다.
섹션별 상세
용어 해설
- KV 캐시(KV Cache)
- — KV Cache는 이전 토큰의 어텐션 Key와 Value를 저장해 긴 문맥에서 같은 계산을 반복하지 않게 하는 메모리 구조입니다. 문맥이 길어질수록 VRAM 사용량이 증가하므로 16GB GPU에서는 모델 가중치, MTP, Vision projector와 함께 용량을 조정해야 합니다.
- 다음 토큰 예측(MTP)
- — MTP는 한 번에 여러 다음 토큰을 예측해 검증하는 방식으로 생성 속도를 높이는 추론 기능입니다. 이 테스트에서는 Qwen3.8-27B의 MTP-1 구성이 64K 문맥에서 약 45 tok/s의 짧은 문맥 생성 속도를 유지하는 데 사용됐습니다.
- GGUF 모델 형식(GGUF)
- — GGUF는 llama.cpp 계열 환경에서 양자화 모델과 관련 메타데이터를 함께 저장하는 파일 형식입니다. Unsloth의 주 GGUF에는 MTP 텐서가 이미 포함되어 있어 별도 MTP GGUF를 불러오면 약 768 MiB의 VRAM을 추가로 사용하게 됩니다.
- 양자화(Quantization)
- — Quantization은 모델 가중치의 표현 정밀도를 낮춰 VRAM 사용량을 줄이는 기법입니다. 이 테스트에서는 IQ4 계열을 Q8 기준과 비교했으며, Unsloth UD-IQ4_XS가 WikiText-2 16개 샘플에서 Perplexity 7.3789와 평균 KLD 0.01800을 기록했습니다.
- 함수 호출 벤치마크(BFCL)
- — BFCL은 모델이 함수 호출 형식과 도구 사용 흐름을 얼마나 정확하게 처리하는지 평가하는 기준입니다. 게시물에서는 단일 턴과 다중 턴 점수를 분리해 비교했고, 27B 모델의 강점이 독립 호출보다 상태를 유지하는 다단계 작업에서 나타났습니다.
언급된 도구
Qwen3.8-27B와 Qwen3.5-9B를 RTX 5060 Ti에서 실행한 추론 런타임입니다. build 10520, Flash Attention, 전체 GPU offload 조건이 사용됐습니다.
Qwen3.8-27B UD-IQ4_XS 양자화와 MTP 텐서가 포함된 GGUF를 제공한 주체로 등장합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.