본문으로 건너뛰기
r/LocalLLaMA조회 3

Ornith 9B로 16GB GPU 코딩 에이전트 최적화

Qwen 3.8 27B 대신 Ornith 9B를 최적화해 16GB GPU에서 최대 36 tok/s 생성 속도와 3시간 30분 연속 작업을 확보했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

저자는 16GB AMD GPU에서 Qwen 3.8 27B를 coding agent 작업에 사용한 결과 속도가 느리다고 판단했다. 대신 Ornith-1.5-9B-GGUF의 9B 모델을 Q6_K로 실행하고 256K context window와 Q8 KV cache를 적용했다. 이 구성은 prompt eval 최대 약 950 tok/s와 generation 36 tok/s를 기록했으며, 실제 작업을 약 3시간 30분 동안 중단 없이 이어갔다. 긴 작업 중에는 속도가 약 500/25 tok/s까지 낮아져 대형 모델 대신 지속 가능한 처리량을 우선한 사례가 됐다.

실용적 조언

  • 16GB AMD GPU에서 긴 coding agent 작업을 수행할 때는 Ornith-1.5-9B-GGUF의 Q6_K와 Q8 KV cache를 조합하고, context window를 262144로 설정하는 구성을 시험할 수 있다. 글의 실제 명령은 -ngl 99, -fa on, --load-mode mlock을 함께 사용했다. 다만 긴 작업에서는 처리량이 약 950/36 tok/s에서 500/25 tok/s 수준으로 낮아질 수 있으므로 단기 prompt eval 수치만으로 전체 경험을 판단하지 않는 편이 낫다.

섹션별 상세

01
작성자는 16GB AMD GPU인 RX 9060 XT에서 Qwen 3.8 27B를 장시간 coding agent 작업에 사용했을 때 속도가 답답할 정도로 느렸다고 했다. 이에 Ornith 1.5의 9B 모델을 Q6_K로 양자화하고 256K context window와 Q8 KV cache를 조합하는 방향으로 설정을 바꿨다. 큰 모델의 성능보다 제한된 VRAM에서 지속적인 작업 속도를 확보하는 선택에 초점이 맞춰져 있다.
02
해당 llama-server 설정에서 prompt eval은 최대 약 950 tok/s, generation은 36 tok/s까지 나왔다. 실제 coding agent 작업에서는 약 3시간 30분 동안 중단 없이 계속 작동했으며, 긴 작업이 진행되면 속도가 약 500/25 tok/s까지 낮아졌다. 따라서 이 사례의 핵심 근거는 단순한 단기 속도 측정이 아니라 긴 작업에서 유지된 실행 시간과 장시간 처리 중 발생한 속도 저하다.

용어 해설

Q6_K 양자화(Q6_K)
모델 가중치를 6비트 계열로 줄여 저장하는 GGUF 양자화 형식이다. 원본보다 메모리 사용량을 낮추면서 추론에 필요한 가중치를 GPU에 적재하기 쉬워지지만, 정밀도와 성능 사이의 절충이 필요하다.
KV 캐시(KV cache)
Transformer가 이전 토큰의 Key와 Value를 저장해 긴 문맥에서 같은 계산을 반복하지 않도록 하는 메모리 구조다. 이 글에서는 Q8 형식으로 저장해 256K context window 설정과 함께 사용했다.
프롬프트 평가(prompt eval)
입력 프롬프트에 포함된 토큰을 모델이 처리하는 단계다. 생성 단계와 달리 여러 입력 토큰을 묶어 계산하므로 처리량이 높게 나타날 수 있으며, 글에서는 최대 약 950 tok/s가 측정됐다.
컨텍스트 윈도우(context window)
모델이 한 요청 안에서 유지하고 처리할 수 있는 토큰 범위다. 글의 설정은 262144 토큰, 즉 256K context window이며 긴 coding agent 작업의 대화와 코드를 계속 담는 데 사용됐다.

코드 예제

text
./llama-server -hf ornith-ai/Ornith-1.5-9B-GGUF:Q6_K `
  -ngl 99 `
  -np 1 `
  -c 262144 `
  -fa on `
  -ctk q8_0 `
  -ctv q8_0 `
  --load-mode mlock `
  --temp 0.6 `
  --top-p 0.95 `
  --top-k 20

llama-server에서 Ornith-1.5-9B-GGUF의 Q6_K 가중치, 256K 문맥, Q8 KV cache와 샘플링 설정을 적용해 추론을 실행하는 명령이다.

언급된 도구

llama-server중립

GGUF 모델에 GPU 레이어, 문맥 길이, KV cache 정밀도와 샘플링 옵션을 지정해 로컬 추론 서버를 실행하는 도구

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 21.수집 2026. 08. 21.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.