본문으로 건너뛰기

16GB GPU에서 Qwen3.8-27B를 에이전트로 쓰기

Qwen3.8-27B IQ4는 RTX 5060 Ti 16GB에서 64K 문맥과 다중 턴 도구 작업을 실용적인 속도로 처리했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

RTX 5060 Ti 16GB에서 Qwen3.8-27B IQ4는 MTP-1과 64K 텍스트 문맥을 함께 사용하면서 짧은 문맥에서 약 45–47 tok/s, 약 55K 토큰 이후 31.3 tok/s를 기록했습니다. Vision은 F16 projector로 동작했지만 VRAM 여유가 136–208 MiB까지 줄어 별도 프로필이 필요했습니다. Unsloth UD-IQ4_XS는 Q8 기준과 가장 가까운 양자화 품질을 보였고, 실제 다중 턴 에이전트 점수에서는 jpetrina 양자화가 40/80으로 38/80의 Unsloth를 근소하게 앞섰습니다. 27B 모델은 단일 함수 호출보다 긴 이력과 의존 도구를 처리하는 상태 유지형 작업에서 Qwen3.5-9B보다 안정적이었습니다.

실용적 조언

  • RTX 5060 Ti 16GB에서 Qwen3.8-27B를 긴 문맥 에이전트로 사용할 때는 MTP-1과 64K 텍스트 프로필을 우선 구성하는 편이 적합합니다. 약 55K 토큰 문맥에서는 생성 속도가 31.3 tok/s로 낮아지므로 짧은 문맥의 45–47 tok/s 수치를 긴 작업 전체에 그대로 적용하면 안 됩니다. Vision을 함께 써야 한다면 64K, MTP, F16 projector를 한 번에 고정하지 말고 문맥을 줄인 별도 프로필을 사용하는 편이 VRAM 부족을 피할 수 있습니다.
  • 다중 단계 도구 작업이 핵심이면 Perplexity가 가장 낮은 양자화를 자동으로 선택하기보다 실제 워크플로 점수를 별도로 측정해야 합니다. 이 테스트에서는 Unsloth UD-IQ4_XS가 Q8 기준에 더 가까웠지만 jpetrina 양자화가 BFCL 다중 턴에서 40/80으로 38/80의 Unsloth를 앞섰습니다. 따라서 사용할 도구, 승인 흐름, 오류 복구, 긴 이력 검색을 포함한 로컬 시나리오를 직접 재현하는 것이 필요합니다.

섹션별 상세

01
작성자는 RTX 5060 Ti 16GB 한 장에서 Qwen3.5-9B를 Qwen3.8-27B로 교체할 수 있는지 평가하면서 토큰 생성 속도뿐 아니라 문맥 용량, 도구 호출, 다중 턴 작업, Vision을 함께 기준으로 삼았습니다. Ubuntu, llama.cpp build 10520, Flash Attention, 가능한 범위의 전체 GPU offload, 단일 슬롯, 동시성 없음, Q4_0 KV cache 조건에서 jpetrina IQ4_XS-pure와 Unsloth UD-IQ4_XS를 비교했습니다. 이 조건은 대형 모델을 여러 GPU에 분산하지 않고 실제 에이전트 작업에 활용하려는 상황에 맞춰져 있습니다.
02
Qwen3.8-27B의 실용적인 구성은 MTP-1을 켠 64K 텍스트 문맥으로 나타났습니다. Unsloth UD-IQ4_XS는 MTP 없이 32K에서 27.4 tok/s와 13,764 MiB를 사용했지만, MTP-1과 64K에서는 45.6 tok/s와 14,918 MiB를 기록했고 F16 Vision projector까지 추가하면 15,680 MiB와 45.4 tok/s가 됐습니다. 약 55K 토큰이 채워진 상태에서도 프롬프트 처리는 738.7 tok/s, prefill 이후 생성은 31.3 tok/s여서 긴 문맥을 유지하는 대화형 에이전트에 사용할 여지가 확인됐습니다.
03
Vision은 F16 projector와 1,024 image-token 할당으로 신문 이미지의 OCR 방식 읽기를 처리했습니다. 다만 64K 문맥, MTP, F16 projector를 동시에 유지하면 남는 VRAM이 136–208 MiB에 불과해 여유가 거의 없었습니다. 따라서 게시자는 64K와 MTP-1을 쓰는 텍스트 에이전트 프로필과 더 작은 문맥으로 필요할 때만 Vision을 불러오는 프로필을 분리하는 방식을 택했습니다.
04
양자화 품질에서는 Unsloth UD-IQ4_XS가 jpetrina IQ4_XS-pure보다 Q8 기준에 가까웠습니다. WikiText-2 16개 샘플과 512-token 문맥에서 Unsloth는 Perplexity 7.3789, 평균 KLD 0.01800, 동일 top token 93.06%, log-PPL 상관 99.63%를 기록했고 jpetrina는 각각 7.4958, 0.02359, 92.11%, 99.51%였습니다. Q8_0의 Perplexity는 7.3858이어서 저수준 logit 충실도만 보면 Unsloth 양자화가 Q8에 매우 근접했습니다.
05
도구 사용 평가에서는 저수준 양자화 품질과 실제 에이전트 성능이 일치하지 않았습니다. Qwen3.5-9B NVFP4는 BFCL 단일 턴 56/100으로 앞섰지만 다중 턴에서는 29/80과 지원 시나리오 5/6을 기록했고, jpetrina Qwen3.8-27B IQ4 MTP-1은 40/80과 6/6, Unsloth Qwen3.8-27B UD-IQ4는 38/80과 6/6을 기록했습니다. 세 모델 모두 별도의 native tool-calling smoke test 8/8을 통과했지만, 27B 모델은 진단 후 변경, 승인된 재시작과 확인, 의존 도구 호출, 누락 매개변수 확인, prompt injection 저항, 약 55K 토큰 이력 검색 같은 상태 유지형 작업에서 더 안정적이었습니다.
06
최종 선택에서는 jpetrina 양자화가 다중 턴 에이전트 점수 40/80으로 Unsloth의 38/80을 근소하게 앞섰습니다. Unsloth는 Perplexity와 logit fidelity가 더 좋았지만 일반 텍스트 생성용으로 더 적합한 대안으로 평가됐고, 품질 지표가 곧바로 에이전트 점수로 이어지지는 않았습니다. 게시자는 이 결과가 공식 BFCL 리더보드 제출이 아니라 단일 GPU, 단일 추론 슬롯, 동시성 없음, 로컬 사용 사례로 구성한 seeded subset 결과라고 제한했습니다.

용어 해설

KV 캐시(KV Cache)
KV Cache는 이전 토큰의 어텐션 Key와 Value를 저장해 긴 문맥에서 같은 계산을 반복하지 않게 하는 메모리 구조입니다. 문맥이 길어질수록 VRAM 사용량이 증가하므로 16GB GPU에서는 모델 가중치, MTP, Vision projector와 함께 용량을 조정해야 합니다.
다음 토큰 예측(MTP)
MTP는 한 번에 여러 다음 토큰을 예측해 검증하는 방식으로 생성 속도를 높이는 추론 기능입니다. 이 테스트에서는 Qwen3.8-27B의 MTP-1 구성이 64K 문맥에서 약 45 tok/s의 짧은 문맥 생성 속도를 유지하는 데 사용됐습니다.
GGUF 모델 형식(GGUF)
GGUF는 llama.cpp 계열 환경에서 양자화 모델과 관련 메타데이터를 함께 저장하는 파일 형식입니다. Unsloth의 주 GGUF에는 MTP 텐서가 이미 포함되어 있어 별도 MTP GGUF를 불러오면 약 768 MiB의 VRAM을 추가로 사용하게 됩니다.
양자화(Quantization)
Quantization은 모델 가중치의 표현 정밀도를 낮춰 VRAM 사용량을 줄이는 기법입니다. 이 테스트에서는 IQ4 계열을 Q8 기준과 비교했으며, Unsloth UD-IQ4_XS가 WikiText-2 16개 샘플에서 Perplexity 7.3789와 평균 KLD 0.01800을 기록했습니다.
함수 호출 벤치마크(BFCL)
BFCL은 모델이 함수 호출 형식과 도구 사용 흐름을 얼마나 정확하게 처리하는지 평가하는 기준입니다. 게시물에서는 단일 턴과 다중 턴 점수를 분리해 비교했고, 27B 모델의 강점이 독립 호출보다 상태를 유지하는 다단계 작업에서 나타났습니다.

언급된 도구

llama.cpp추천

Qwen3.8-27B와 Qwen3.5-9B를 RTX 5060 Ti에서 실행한 추론 런타임입니다. build 10520, Flash Attention, 전체 GPU offload 조건이 사용됐습니다.

Unsloth추천

Qwen3.8-27B UD-IQ4_XS 양자화와 MTP 텐서가 포함된 GGUF를 제공한 주체로 등장합니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.