본문으로 건너뛰기

Muse Glimmer과 ExecuTorch의 로컬 실행 지원

Muse Glimmer 30B를 ExecuTorch PTE로 NVIDIA와 Apple Silicon에서 DFlash와 K-quant로 최적화해 로컬 에이전트 워크플로우를 지원한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Muse Glimmer는 Meta의 300억 파라미터 멀티모달 모델을 ExecuTorch의 AOT(PTE) 파이프라인으로 로컬 NVIDIA와 Apple Silicon에서 실행할 수 있게 만든 배포 흐름과 도구를 함께 제공한다. ExecuTorch는 PyTorch 구현을 torch.export로 PTE로 직렬화한 뒤 Triton/CUDA와 MLX/Metal용 네이티브 커널을 생성해 성능을 최적화하며, DFlash speculative decoding과 K-quant 같은 기법을 통합해 지연과 메모리 사용을 줄인다. 예제 빌드·실행 명령과 성능 비교(예: M5 Pro에서 DFlash 33.0 tok/s vs Solo 21.6 tok/s, 약 52.8% 향상)를 통해 에이전트 워크플로우와 긴 컨텍스트 사용 사례에서의 실용성을 확인할 수 있다.

섹션별 상세

Muse Glimmer는 Meta의 Muse Spark에서 증류된 300억 파라미터 오픈 가중치 모델로, 텍스트와 이미지 입력을 모두 처리하도록 설계되어 ExecuTorch 런타임으로 로컬 장치에서 실행할 수 있다. 모델은 GGUF 체크포인트를 직접 내보내 ExecuTorch의 AOT(PTE) 파이프라인으로 최적화되며, CUDA와 Apple Metal(MLX) 타깃을 모두 지원한다. 이 구조는 연구자가 PyTorch에서 모델과 디코딩 로직을 구현하면 백엔드별로 다시 재작성할 필요 없이 최종 배포 번들을 만들 수 있게 해준다.
ExecuTorch 접근 방식은 모델과 디코딩 전략을 PyTorch로 유지한 채 torch.export 기반의 AOT 파이프라인으로 백엔드별 lowering을 처리하는 것이다. 이 과정에서 Triton 커널 컴파일과 오토튜닝, MLX/Metal 네이티브 구현을 생성해 전체 실행 경로를 앞서 최적화하므로 개별 연산 단위 최적화 대비 더 일관된 성능 향상을 얻는다. 결과적으로 Muse Glimmer의 이미지·텍스트 멀티모달 입력, GGUF 직접 로드, K-quant 실행, 128K+ 토큰 컨텍스트와 같은 기능을 네이티브 방식으로 제공할 수 있다.
사전 제작된 PTE(Preferred)와 자체 빌드 방법을 모두 제공해 빠르게 시험하거나 타깃 하드웨어에 맞춰 재내보내기할 수 있다. PyTorch 그래프에서 직접 PTE를 생성하면 CUDA에서는 해당 GPU 아키텍처에 맞춘 Triton 커널이 컴파일되고 MLX에서는 Metal용 최적화가 적용되므로, 같은 모델이라도 내보낸 환경과 실행 환경을 일치시키는 것이 성능 측면에서 권장된다. 제공된 가이드와 예제 명령으로 solo_runner와 dflash_runner 같은 바이너리를 빌드해 바로 실행할 수 있다.
성능 측정에서 DFlash speculative decoding은 M5 Pro에서 Solo(21.6 tok/s) 대비 DFlash(33.0 tok/s)로 약 52.8% 향상을 보였고, 이는 품질 저하 없이 처리량을 높인 사례로 제시되었다. ExecuTorch 측은 DFlash를 위해 draft와 target 경로의 weight sharing을 지원하고 PTE에 동적 블록 차원을 내보내 런타임에서 블록 길이를 선택하도록 구현했다. 또한 prefill과 decode 측정 결과를 A100과 M5-Max에서 비교해 백엔드별 성능 특성을 보여주며, decode 차트에는 DFlash의 acceptance rate 표기가 함께 포함되어 있다.
근거
  • M5 Pro에서 DFlash 설정은 Solo(21.6 tok/s) 대비 33.0 tok/s로 약 52.8% 향상을 보였고, 이 성능 향상은 품질 저하 없이 달성되었다. Figure 1 캡션과 해당 실험 데모 GIF에 표기된 throughput 수치(21.6 tok/s vs 33.0 tok/s)와 퍼센트 개선값.
하드웨어별 최적화로 CUDA는 decode를 CUDA graph로 캡처해 커널 런치 오버헤드를 줄이고 packed K-quant 커널로 낮은 배치에서 decode를 가속하며, MLX 측은 RMSNorm·RoPE·SDPA·KV-cache와 양자화 연산을 Metal 네이티브 또는 커스텀 구현으로 낮춰 성능을 확보한다. K-quant 가중치는 CUDA의 dp4a GEMV 또는 MLX의 repacked/fused Metal 커널로 매핑되며, MLX에서는 손실 없는 경우 인접 서브블록 병합을 통해 메모리와 메모리 접근을 최적화한다. 이러한 최적화는 장치별 특성에 맞춘 런타임 성능 확보를 목표로 한다.
에이전트 통합 측면에서 한 번의 모델 로드로 여러 세션을 분리해 서비스하도록 세션별 mutable-state rebinding을 도입했고, XML 도구 호출 포맷을 파싱해 한 턴에 여러 도구 호출을 허용하는 파서를 추가했다. Pi 코딩 에이전트와의 연동 예시는 에이전트가 파일 생성, 패키지 설치, 테스트 작성 및 실행을 포함한 반복적 추론-툴 사용 루프를 실행해 결과를 점진적으로 개선하는 워크플로우를 보여준다. 이로써 Muse Glimmer는 단일 모델로 에이전트형 작업을 로컬에서 실행 가능한 형태로 만드는 것을 목표로 한다.

이미지 분석

M5 Pro에서의 텍스트·이미지 입력 실험 GIF로, 입력 이미지(예: 에펠탑)와 해당 요청에 대한 모델 응답을 보여준다.
Photo

이 GIF는 Muse Glimmer의 멀티모달 동작을 검증하는 데모로서 이미지와 텍스트 프롬프트를 결합한 실행 결과를 보여준다. 또한 같은 환경에서 Solo와 DFlash 설정의 처리량을 비교한 캡션(21.6 tok/s vs 33.0 tok/s)을 함께 제시해 DFlash의 실사용 성능 향상을 시각적으로 보조한다. 멀티모달 입력 파이프라인이 로컬 Apple Silicon에서 동작하는 사례를 확인하는 용도로 유용하다.

M5 Pro에서의 텍스트·이미지 입력 실험 GIF로, 입력 이미지(예: 에펠탑)와 해당 요청에 대한 모델 응답을 보여준다.

Pi 코딩 에이전트와 연동한 에이전트 파이프라인의 터미널 실행 화면을 캡처한 GIF로, 에이전트가 도구를 호출하고 파일을 생성·수정하는 흐름을 보여준다.
Screenshot

이 스크린샷은 Muse Glimmer가 에이전트 환경에서 어떻게 도구 호출을 오케스트레이션하는지를 보여주며, 서버 시작 로그와 Pi 에이전트의 상호작용이 포함되어 있다. 에이전트가 툴 파서, 파일 생성, 테스트 실행 같은 반복 작업을 거쳐 점진적으로 결과를 개선하는 실행 흐름을 시각적으로 확인할 수 있다. 로컬 에이전트 통합 사례 증거로서 문서의 에이전트 관련 설명을 보완한다.

Pi 코딩 에이전트와 연동한 에이전트 파이프라인의 터미널 실행 화면을 캡처한 GIF로, 에이전트가 도구를 호출하고 파일을 생성·수정하는 흐름을 보여준다.

NVIDIA A100과 Apple M5-Max에서 텍스트 전용 입력을 대상으로 한 prefill 및 decode 처리량 비교 차트로, DFlash 적용 여부에 따른 성능과 DFlash acceptance rate 주석을 포함한다.
Chart

이 차트는 두 하드웨어에서 문맥 길이 변화에 따른 prefill과 decode 처리량을 비교해 백엔드별 성능 특성을 보여준다. 문서 본문과 맞물려 DFlash가 decode 처리량에 긍정적 영향을 준다는 근거를 제공하며, decode 패널에는 DFlash의 acceptance rate 수치가 표기되어 있어 speculative decoding의 실효성을 판단할 수 있다. 또한 A100과 M5-Max 간의 성능 차이를 통해 사용자에게 타깃 디바이스 선택 시 고려할 기술적 근거를 준다.

NVIDIA A100과 Apple M5-Max에서 텍스트 전용 입력을 대상으로 한 prefill 및 decode 처리량 비교 차트로, DFlash 적용 여부에 따른 성능과 DFlash acceptance rate 주석을 포함한다.

용어 해설

사전 컴파일된 실행 아티팩트(PTE)
PTE는 ExecuTorch의 torch.export 기반 AOT 스택으로부터 생성된 직렬화된 실행 아티팩트로, 특정 백엔드(CUDA/MLX)에 맞춰 그래프 수준에서 최적화되어 배포용 런타임이 직접 로드해 실행한다. 빌드 과정에서 Triton 커널 컴파일·오토튠이나 Metal용 특화 변환이 포함되므로 동일 모델 소스에서 백엔드별 최적화 결과를 얻을 수 있다. 사전 생성된 PTE는 다운로드해 바로 실행하거나, 동일 아키텍처에서 재내보내기해 최적 성능을 얻는 용도로 쓰인다.
모델 배포용 체크포인트 포맷(GGUF)
GGUF는 Muse Glimmer가 공개한 체크포인트 포맷으로, ExecuTorch는 GGUF로부터 직접 가중치를 매핑해 PTE로 내보낸다. 이 흐름은 별도의 변환 레이어 없이 원본 가중치와 메타데이터를 보존하면서 quantization 및 런타임 최적화를 적용할 수 있도록 설계되어 있다. 결과적으로 사용자 입력 GGUF 파일을 기반으로 CUDA나 MLX 타깃에 맞춘 실행 번들을 생성할 수 있다.
정밀도 기반 K-quant 양자화(K-quant)
K-quant는 Q4_K/Q5_K/Q6_K 같은 양자화 표기를 ExecuTorch에서 packed INT4/5/6로 매핑해 dp4a GEMV 같은 CUDA 명령 또는 MLX/Metal용 재포장·퓨즈 커널로 실행하는 양자화 방식이다. MLX 쪽에서는 손실이 없는 경우 인접 서브블록을 병합해 그룹 크기를 키워 메모리 접근과 연산을 효율화한다. 이 방식은 낮은 비트폭에서 decode·prefill 성능을 유지하면서 모델의 메모리 사용을 줄이는 목적을 가진다.
병렬 확률적 추론 기법(DFlash (speculative decoding))
DFlash는 병렬화된 speculative decoding 접근으로, draft와 target 경로를 함께 사용해 지연을 줄이는 기법이다. ExecuTorch는 draft와 target의 weight sharing을 지원하고 두 경로를 한 PTE에 동적으로 내보내어 런타임에서 블록 길이를 선택할 수 있도록 설계했다. 이로써 작은 토큰 단위 검증을 통해 단일 토큰 응답 지연을 줄이는 동시에 전체 처리량을 높이는 효과를 노린다.
장문 대화·상태 유지용 대용량 컨텍스트(128K+ 토큰 컨텍스트)
Muse Glimmer는 128K 이상의 토큰 컨텍스트를 지원하도록 설계되었으며, KV-cache 관리는 52개 레이어 중 13개만 글로벌로 유지하고 나머지는 슬라이딩 윈도우로 처리해 메모리 성장을 제어한다. ExecuTorch는 이러한 구조를 효율적으로 낮은 오버헤드로 실행되게 하여 에지 디바이스에서도 긴 대화 히스토리를 다룰 수 있게 한다. 긴 컨텍스트는 에이전트의 장기 추론과 문맥 보존이 필요한 작업에서 실용성을 제공한다.

코드 예제

bash
cd examples/models/muse-glimmer
cmake --workflow --preset muse-glimmer-cuda

이 명령은 ExecuTorch 예제 디렉터리에서 CUDA용 빌드 프리셋을 사용해 런너 실행 파일들을 사전 컴파일한다. cmake가 Triton 컴파일, MLX 또는 Metal 연결 정보를 포함한 전체 워크플로우를 실행해 solo_runner와 dflash_runner 같은 바이너리를 생성하므로, 이후 PTE를 바로 실행할 수 있는 네이티브 실행환경이 만들어진다. 동일한 절차를 macOS에서는 muse-glimmer-mlx 프리셋으로 반복해 Apple Silicon 타깃 런너를 만든다.

bash
PROMPT='userDescribe this image: assistant'
cmake-out/examples/models/muse-glimmer/dflash_runner \
  --model_path artifacts/dflash-vision/model.pte \
  --data_path artifacts/dflash-vision/aoti_cuda_blob.ptd \
  --tokenizer_path assets/hf/tokenizer.json \
  --image_path image.jpg --prompt "$PROMPT" \
  --block_length 4 --n_draft 3 --temperature 0 --max_new_tokens 256

이 실행 예시는 사전생성된 DFlash PTE와 관련 데이터 블롭을 dflash_runner로 직접 실행해 멀티모달 추론을 수행하는 방법을 보여준다. 명령 인수로 토크나이저 경로, 입력 이미지, 초안 블록 길이 및 초안 개수(n_draft)를 지정하면 런타임이 draft와 target 경로를 병행해서 실행하고 검증 블록을 통해 최종 출력을 생산한다. 이 방식은 실험 환경에서 DFlash 설정을 빠르게 비교하거나 에이전트 서버의 전용 worker로 연결할 때 유용하다.

bash
python -m executorch.examples.models.muse_glimmer.serving.serve \
  --model-path artifacts/dflash-vision/model.pte \
  --data-path artifacts/dflash-vision/aoti_cuda_blob.ptd \
  --tokenizer-path assets/hf/tokenizer.json --hf-tokenizer assets/hf \
  --worker-bin cmake-out/examples/models/muse-glimmer/muse_glimmer_worker \
  --tool-parser atem --max-context 131072

이 명령은 Muse Glimmer PTE를 백그라운드 서버로 띄워 에이전트가 HTTP API를 통해 모델을 호출하게 하는 절차이다. serve 모듈은 worker 바이너리를 로드해 세션별 mutable-state 바인딩과 툴 호출 파싱 기능을 제공하므로 Pi 같은 에이전트가 도구 호출·파일 생성·테스트 실행 같은 워크플로우를 안전하게 분리해 사용할 수 있다. 최대 컨텍스트 길이를 131072로 지정하면 긴 대화 상태를 유지하면서 모델이 동작하게 된다.

기술

  • Muse Glimmer
  • ExecuTorch
  • DFlash
  • GGUF
  • K-quant
  • Pi

활용 사례

  • 이미지 이해가 포함된 멀티모달 에이전트 워크플로우에서 낮은 지연과 높은 처리량을 동시에 필요로 하는 서비스.
  • 로컬 개발 환경에서 에이전트가 파일 생성·테스트 실행·패키지 설치 같은 작업을 순차적으로 수행하는 코딩 보조 워크플로우.
  • 긴 문맥(128K+ 토큰)을 필요로 하는 대화형 에이전트나 세션 기반 장기 상태 보존 응용.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 10.수집 2026. 08. 10.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.