본문으로 건너뛰기

Muse Glimmer를 llama.cpp와 Pi로 로컬 코딩에 연결하기

DFlash와 llama.cpp로 Muse Glimmer를 가속해 Pi 기반 로컬 코딩 에이전트로 활용하는 방법을 다룹니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Muse Glimmer는 Hugging Face의 GGUF 주 모델과 DFlash drafter를 llama.cpp에 함께 올려 RTX 3090에서 로컬 추론을 수행하고, Pi를 통해 터미널 기반 Agentic Coding에 연결할 수 있습니다. Speculative Decoding 설정에서 초기 약 46 tokens/second, 긴 코딩 작업 약 127 tokens/second가 측정됐으며 FastAPI·SQLite 작업 관리 API를 약 2분 만에 만들고 12개 테스트를 통과시켰습니다. 반면 HTML 게임 생성 결과는 Qwen3.8-27B보다 약해 작업 유형에 따른 품질 편차가 남아 있지만, 코드와 데이터를 외부 서비스에 보내지 않는 로컬 개발 환경이라는 점이 핵심 가치입니다.

섹션별 상세

01
Muse Glimmer를 로컬에서 실행하려면 Hugging Face의 주 모델과 DFlash drafter를 먼저 확보해야 합니다. 글의 명령은 16.8 GB Muse Glimmer GGUF 파일과 1.63 GB DFlash GGUF 파일을 /workspace/muse-glimmer에 저장하는 순서로 구성됩니다. 주 모델이 실제 응답을 만들고 DFlash가 다음 토큰 후보를 미리 생성하므로 이후 llama.cpp에서 두 파일을 함께 사용할 수 있습니다.
bash
hf download meta-models/Muse-Glimmer-30B-GGUF \
muse-glimmer-30B-kquant-17gb.gguf \
--local-dir /workspace/muse-glimmer

hf download meta-models/Muse-Glimmer-30B-GGUF \
dflash-kquant.gguf \
--local-dir /workspace/muse-glimmer

Hugging Face에서 Muse Glimmer 주 모델과 DFlash drafter를 같은 로컬 디렉터리에 내려받습니다.

02
llama.cpp는 CUDA 지원으로 빌드한 뒤 llama-server에 주 모델과 DFlash 파일을 각각 -m과 -md로 전달합니다. --spec-type draft-dflash와 --spec-draft-n-max 15가 추측 디코딩 후보 생성을 설정하고, -ngl all과 --spec-draft-ngl all이 두 모델의 GPU 처리를 지정하며, --ctx-size 16384가 컨텍스트 크기를 정합니다. RTX 3090 환경에서 초기 응답 속도는 약 46 tokens/second였고 긴 코딩 작업에서는 약 127 tokens/second까지 올라갔지만 HTML 게임 생성 결과는 Qwen3.8-27B보다 약했습니다.
bash
llama-server \
-m /workspace/muse-glimmer/muse-glimmer-30B-kquant-17gb.gguf \
-md /workspace/muse-glimmer/dflash-kquant.gguf \
--spec-type draft-dflash \
--spec-draft-n-max 15 \
-ngl all \
--spec-draft-ngl all \
-fa on \
--ctx-size 16384 \
--alias muse \
--host 0.0.0.0 \
--port 8080 \
--jinja

llama.cpp 서버에 주 모델과 DFlash drafter를 연결하고 Speculative Decoding, GPU 오프로딩, 16,384 컨텍스트를 활성화합니다.

llama.cpp Web UI에서 Muse Glimmer의 응답과 토큰 수, 처리 시간, 생성 속도가 표시됩니다.
Screenshot화면에는 짧은 인사 응답에 대해 136 tokens, 2.9초, 46.92 t/s가 나타나 초기 실행 속도를 확인할 수 있습니다. 글에서 언급한 약 46 tokens/second 측정값과 연결되며, 로컬 서버가 실제 대화 요청을 처리하는 장면입니다.
Muse Glimmer가 생성한 JavaScript Canvas 게임 코드 일부와 토큰 처리 정보가 표시됩니다.
Screenshot코드에는 캔버스 변환, 회전, 색상 지정, 원형 도형 그리기 같은 게임 렌더링 로직이 보입니다. 화면 하단에는 1,700 tokens, 13초, 127.41 t/s가 표시되어 장시간 코딩 작업에서 측정된 높은 생성 속도를 뒷받침합니다.
Muse Glimmer가 생성한 Flappy Bird 형태의 HTML 게임 시작 화면입니다.
Screenshot파란색 게임 화면에 점수 0, Flappy Bird 제목, Tap·Click·Space 조작 안내와 Best 0이 표시됩니다. 게임 결과물을 시각적으로 확인할 수 있지만 글에서는 이 HTML 게임이 제대로 작동하지 않았고 Qwen3.8-27B가 더 나았다고 평가합니다.
03
Pi는 http://localhost:8080/v1에서 실행 중인 llama.cpp 서버를 자동으로 찾기 때문에 별도의 models.json 설정이 필요하지 않습니다. 사용자는 Pi를 설치하고 huggingface/pi-llama 확장을 추가한 뒤 /model에서 llama-cpp 제공자의 muse 모델을 선택합니다. 이 연결로 모델이 터미널 프로젝트의 파일 작성, 명령 실행, 테스트와 디버깅을 이어서 수행하는 로컬 코딩 흐름이 만들어집니다.
터미널에서 Hugging Face 제공 모델 목록과 llama.cpp의 muse 모델이 표시됩니다.
Screenshot화면에는 여러 Hugging Face 모델과 함께 llama.cpp 제공자의 muse가 선택된 상태로 나타납니다. 모델 카탈로그가 갱신되고 Model Name이 muse로 표시되어 Pi 또는 연결된 터미널 환경에서 Muse Glimmer를 선택하는 과정을 보여줍니다.
Pi 터미널에서 llama.cpp의 muse 모델이 인사 요청에 응답한 화면입니다.
Screenshot터미널에는 사용자 입력 hey와 모델의 응답, llama.cpp 제공자와 muse 모델 정보가 함께 표시됩니다. 16,384 tokens 컨텍스트가 로드됐다는 문구가 있어 글의 --ctx-size 16384 설정과 Pi를 통한 로컬 대화 연결을 확인할 수 있습니다.
04
실험 과제는 FastAPI와 SQLite를 이용한 작업 관리 API 구축이었으며, 생성·조회·수정·삭제 엔드포인트와 입력 검증, 오류 처리, pytest 테스트, requirements.txt와 README.md를 요구했습니다. Muse Glimmer는 약 2분 동안 프로젝트를 만들었고, 테스트 실행 중 발견한 문제를 수정한 뒤 다시 실행하는 작업까지 처리했습니다. 최종 화면에는 12개 테스트가 모두 통과했고, API 문서에는 POST·GET·PUT·DELETE 작업 엔드포인트와 /health 경로가 표시됩니다.
bash
curl -fsSL https://pi.dev/install.sh | sh
pi install git:github.com/huggingface/pi-llama

Pi와 Hugging Face의 llama.cpp 확장을 설치해 로컬 llama.cpp 서버를 코딩 에이전트에 연결합니다.

생성된 FastAPI 프로젝트의 주요 파일과 pytest 테스트 12개 통과 결과가 표시됩니다.
Screenshot화면에는 database.py, models.py, schemas.py, crud.py, routers/tasks.py, main.py와 tests 디렉터리가 나열됩니다. 이어서 CRUD와 health check를 포함한 12개 pytest 항목이 모두 PASSED로 표시되어 모델이 API 구현과 테스트를 완료한 결과를 보여줍니다.
FastAPI가 생성한 Task Management API의 OpenAPI 문서 화면입니다.
Screenshot문서 화면에는 tasks 그룹 아래 POST와 GET /tasks/, GET·PUT·DELETE /tasks/{task_id} 엔드포인트가 표시됩니다. 생성, 조회, 수정, 삭제 기능이 API 문서에 등록되어 있어 글의 요구사항과 생성된 프로젝트 구조가 일치함을 확인할 수 있습니다.
Task Management API의 health, CRUD, 검증 오류와 404 응답 테스트 결과가 정리된 터미널 화면입니다.
Screenshot테스트 요약에는 /health의 200 응답, 유효한 POST의 201 응답, 제목 누락 시 422 응답, 존재하지 않는 작업의 404 응답이 포함됩니다. 수정·삭제 작업에서도 성공과 오류 경로를 함께 검증해 단순 생성뿐 아니라 입력 검증과 HTTP 오류 처리를 확인합니다.
05
글의 결론은 Muse Glimmer, llama.cpp, DFlash와 Pi의 조합이 RTX 3090·4090·5090 같은 GPU에서 코드와 데이터를 외부 서비스로 보내지 않는 로컬 에이전트형 코딩 환경을 구성한다는 것입니다. 다만 HTML 게임처럼 결과 품질이 고르지 않은 작업도 있어 모든 코딩 용도에서 Qwen3.8-27B보다 앞선다고 보기는 어렵습니다. 설정이 성숙하면 생성 속도와 다단계 코딩 처리 품질이 더 나아질 여지가 있다는 평가입니다.

용어 해설

추측 디코딩(Speculative Decoding)
작은 초안 모델이 다음 토큰 후보를 먼저 만들고 주 모델이 이를 한 번에 검증하는 생성 방식입니다. 후보가 승인되면 주 모델의 순차 계산을 일부 건너뛸 수 있어 출력 속도를 높입니다. 이 글에서는 DFlash drafter와 Muse Glimmer를 결합해 로컬 코딩 작업의 토큰 생성량을 높이는 데 사용합니다.
DFlash
Muse Glimmer의 다음 토큰 후보를 빠르게 예측하는 별도 drafter 모델입니다. llama.cpp가 주 모델과 DFlash 파일을 함께 GPU에 올린 뒤 draft-dflash 설정으로 후보를 생성하고 검증하는 흐름을 구성합니다. 글에서는 초기 약 46 tokens/second, 장시간 코딩 작업 약 127 tokens/second의 속도 측정에 사용됩니다.
에이전트형 코딩(Agentic Coding)
코딩 모델이 사용자의 요구를 여러 단계의 파일 작성, 실행, 테스트, 디버깅 작업으로 나누어 직접 처리하는 방식입니다. Pi가 모델과 터미널 프로젝트를 연결하고 모델이 명령 실행과 오류 수정까지 이어 가는 구조를 취합니다. 이 글에서는 FastAPI와 SQLite 기반 API를 약 2분 동안 생성하고 테스트하는 사례로 검증합니다.
GGUF 모델 형식(GGUF)
llama.cpp에서 로컬 추론에 사용하는 모델 파일 형식입니다. 글에서는 16.8 GB 크기의 Muse Glimmer 주 모델과 1.63 GB 크기의 DFlash drafter를 GGUF 파일로 내려받아 llama-server에 전달합니다. 파일을 같은 디렉터리에 저장한 뒤 GPU 레이어와 컨텍스트 크기를 설정해 실행합니다.

기술

  • Muse Glimmer
  • llama.cpp
  • DFlash
  • Pi
  • Hugging Face CLI
  • CUDA
  • FastAPI
  • SQLite
  • pytest
  • Qwen3.8-27B
  • RTX 3090
  • RTX 4090
  • RTX 5090
  • GGUF

활용 사례

  • 터미널에서 파일을 생성하고 실행하는 로컬 코딩 에이전트
  • FastAPI와 SQLite를 이용한 작업 관리 API 구축
  • 코드 테스트와 오류 수정이 포함된 다단계 개발 작업
  • 외부 서비스로 코드와 데이터를 전송하지 않는 개인용 AI 코딩

언급된 리소스

튜토리얼Pi
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 21.수집 2026. 08. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.