TL;DR
Muse Glimmer는 Hugging Face의 GGUF 주 모델과 DFlash drafter를 llama.cpp에 함께 올려 RTX 3090에서 로컬 추론을 수행하고, Pi를 통해 터미널 기반 Agentic Coding에 연결할 수 있습니다. Speculative Decoding 설정에서 초기 약 46 tokens/second, 긴 코딩 작업 약 127 tokens/second가 측정됐으며 FastAPI·SQLite 작업 관리 API를 약 2분 만에 만들고 12개 테스트를 통과시켰습니다. 반면 HTML 게임 생성 결과는 Qwen3.8-27B보다 약해 작업 유형에 따른 품질 편차가 남아 있지만, 코드와 데이터를 외부 서비스에 보내지 않는 로컬 개발 환경이라는 점이 핵심 가치입니다.
섹션별 상세
hf download meta-models/Muse-Glimmer-30B-GGUF \
muse-glimmer-30B-kquant-17gb.gguf \
--local-dir /workspace/muse-glimmer
hf download meta-models/Muse-Glimmer-30B-GGUF \
dflash-kquant.gguf \
--local-dir /workspace/muse-glimmerHugging Face에서 Muse Glimmer 주 모델과 DFlash drafter를 같은 로컬 디렉터리에 내려받습니다.
llama-server \
-m /workspace/muse-glimmer/muse-glimmer-30B-kquant-17gb.gguf \
-md /workspace/muse-glimmer/dflash-kquant.gguf \
--spec-type draft-dflash \
--spec-draft-n-max 15 \
-ngl all \
--spec-draft-ngl all \
-fa on \
--ctx-size 16384 \
--alias muse \
--host 0.0.0.0 \
--port 8080 \
--jinjallama.cpp 서버에 주 모델과 DFlash drafter를 연결하고 Speculative Decoding, GPU 오프로딩, 16,384 컨텍스트를 활성화합니다.





curl -fsSL https://pi.dev/install.sh | sh
pi install git:github.com/huggingface/pi-llamaPi와 Hugging Face의 llama.cpp 확장을 설치해 로컬 llama.cpp 서버를 코딩 에이전트에 연결합니다.



용어 해설
- 추측 디코딩(Speculative Decoding)
- — 작은 초안 모델이 다음 토큰 후보를 먼저 만들고 주 모델이 이를 한 번에 검증하는 생성 방식입니다. 후보가 승인되면 주 모델의 순차 계산을 일부 건너뛸 수 있어 출력 속도를 높입니다. 이 글에서는 DFlash drafter와 Muse Glimmer를 결합해 로컬 코딩 작업의 토큰 생성량을 높이는 데 사용합니다.
- DFlash
- — Muse Glimmer의 다음 토큰 후보를 빠르게 예측하는 별도 drafter 모델입니다. llama.cpp가 주 모델과 DFlash 파일을 함께 GPU에 올린 뒤 draft-dflash 설정으로 후보를 생성하고 검증하는 흐름을 구성합니다. 글에서는 초기 약 46 tokens/second, 장시간 코딩 작업 약 127 tokens/second의 속도 측정에 사용됩니다.
- 에이전트형 코딩(Agentic Coding)
- — 코딩 모델이 사용자의 요구를 여러 단계의 파일 작성, 실행, 테스트, 디버깅 작업으로 나누어 직접 처리하는 방식입니다. Pi가 모델과 터미널 프로젝트를 연결하고 모델이 명령 실행과 오류 수정까지 이어 가는 구조를 취합니다. 이 글에서는 FastAPI와 SQLite 기반 API를 약 2분 동안 생성하고 테스트하는 사례로 검증합니다.
- GGUF 모델 형식(GGUF)
- — llama.cpp에서 로컬 추론에 사용하는 모델 파일 형식입니다. 글에서는 16.8 GB 크기의 Muse Glimmer 주 모델과 1.63 GB 크기의 DFlash drafter를 GGUF 파일로 내려받아 llama-server에 전달합니다. 파일을 같은 디렉터리에 저장한 뒤 GPU 레이어와 컨텍스트 크기를 설정해 실행합니다.
기술
- Muse Glimmer
- llama.cpp
- DFlash
- Pi
- Hugging Face CLI
- CUDA
- FastAPI
- SQLite
- pytest
- Qwen3.8-27B
- RTX 3090
- RTX 4090
- RTX 5090
- GGUF
활용 사례
- 터미널에서 파일을 생성하고 실행하는 로컬 코딩 에이전트
- FastAPI와 SQLite를 이용한 작업 관리 API 구축
- 코드 테스트와 오류 수정이 포함된 다단계 개발 작업
- 외부 서비스로 코드와 데이터를 전송하지 않는 개인용 AI 코딩
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.