TL;DR
이 글은 AMD RX 480 8GB와 RX 9070 XT 16GB처럼 비교적 저렴한 GPU에서 open weights LLM을 self-hosting한 경험을 기록합니다. 작은 Gemma 4, gpt-oss, Qwen 모델은 빠르지만 잘못된 도구 호출과 환각, 무한 반복 때문에 중요한 작업을 맡기기 어려웠고, 27B 모델도 긴 인프라 작업에서는 검증과 개입이 필요했습니다. 반면 UD-Q2_K_XL로 양자화한 Qwen 3.8 27B는 RX 9070 XT에서 약 30~50 tok/s를 내고 도구 호출 안정성과 지속성이 개선되어 실제 engineering 작업을 맡길 만한 수준에 가까워졌습니다. 다만 로컬 실행은 하드웨어 비용과 설정 부담을 요구하므로, privacy·비용·data sovereignty를 중시하면서 수동 설정과 검증을 감수할 때 적합하다는 결론입니다.
섹션별 상세







용어 해설
- 양자화(Quantization)
- — 양자화는 모델 가중치의 표현 정밀도를 낮춰 파일 크기와 메모리 사용량을 줄이는 기법입니다. 이 글에서는 UD-Q4_K_XL과 UD-Q2_K_XL 같은 양자화 버전을 사용해 제한된 VRAM에서 더 큰 Qwen 모델을 실행하지만, 모델 정확도와 응답 품질이 일부 낮아질 수 있다는 절충이 핵심으로 나타납니다.
- Mixture of Experts
- — Mixture of Experts는 하나의 거대한 모델 안에 여러 전문가 모듈을 두고, 각 입력을 처리할 때 일부 전문가만 활성화하는 구조입니다. 전체 파라미터 수는 크더라도 실제 계산에 참여하는 부분을 줄일 수 있어, 모델 규모와 실행 비용 사이의 균형을 맞추는 데 사용됩니다.
- Context Window
- — Context Window는 모델이 한 번에 입력과 이전 대화, 도구 실행 결과를 유지할 수 있는 토큰 범위입니다. 범위가 커지면 긴 agentic 세션과 많은 파일을 처리할 수 있지만 메모리 사용량도 늘어나므로, 글에서는 llama.cpp와 OpenCode 양쪽에서 128K로 맞추고 GPU VRAM에 들어오는지 확인합니다.
- Tool Calling
- — Tool Calling은 모델이 파일 읽기·수정, 웹 검색 같은 외부 기능을 호출하도록 요청을 생성하는 방식입니다. 글의 로컬 모델 실험에서는 잘못된 도구 호출과 반복 호출이 자주 발생했으며, 결정적 도구와 테스트를 갖춘 harness가 모델의 실행 범위를 제한하는 장치로 작동합니다.
- Vulkan Backend
- — Vulkan Backend는 GPU에서 llama.cpp 추론을 실행하는 그래픽·컴퓨트 API 기반 backend입니다. AMD RX 480이 최신 ROCm 지원 대상에서 제외되어 작성자는 Linux에서 Vulkan 기반 실행 경로를 사용했고, RX 9070 XT에서는 Qwen 3.8 27B가 약 30~50 tok/s로 생성됐습니다.
기술
- AMD RX 480 8GB
- AMD RX 9070 XT 16GB
- llama.cpp
- Vulkan
- OpenCode
- Pi
- Podman
- Bazzite
- SteamOS
- Hugging Face
- unsloth
- Qwen 3.8 27B
- Gemma 4
- gpt-oss
- Claude Code
활용 사례
- 로컬 coding agent 실행
- 인프라 저장소 점검
- Hugo 설정 수정
- rsync 백업 스크립트 작성
- 공시 재무보고서 요약과 red flag 탐색
- 게임과 LLM 실행을 병행하는 GPU 활용
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.