본문으로 건너뛰기

TensorSharp와 llama.cpp의 Muse Glimmer 추론 성능 비교

TensorSharp는 짧은 입력의 Muse Glimmer Prefill에서 앞섰지만 긴 컨텍스트와 일부 DFlash 구간에서는 llama.cpp가 더 빨랐습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 Meta의 Muse Glimmer 30B Unsloth GGUF 모델을 TensorSharp와 llama.cpp에서 NVIDIA RTX PRO 6000 Blackwell GPU로 비교했습니다. TensorSharp는 60~2050토큰의 짧은 입력에서 Prefill을 1.16~1.27배 빠르게 처리했지만, 16,126토큰 이상에서는 llama.cpp가 앞섰고 Decode도 긴 입력에서 더 빨랐습니다. DFlash speculative decoding은 501토큰에서 TensorSharp가 180.3tok/s를 기록했지만 긴 입력에서는 llama.cpp가 우세했으며, 드래프터의 추가 프롬프트 처리로 양쪽 Prefill 속도가 감소했습니다. 두 개의 RTX PRO 4000 GPU에서는 텐서 병렬 실행으로 Prefill 1.34배, Decode 1.57배의 향상이 측정됐습니다.

주요 논점

01찬성소수

제시된 조건에서 TensorSharp는 짧은 프롬프트의 일반 Prefill과 일부 DFlash Decode 구간에서 llama.cpp보다 높은 처리량을 기록했습니다. 다만 긴 컨텍스트와 일부 speculative decoding 구간에서는 llama.cpp가 앞서므로 우위가 모든 조건에 적용되지는 않습니다.

02중립소수

TensorSharp의 성능은 입력 길이와 실행 모드에 따라 달라집니다. 짧은 입력과 두 GPU 텐서 병렬에서는 유리한 수치가 나왔지만, 긴 입력에서는 llama.cpp의 Prefill과 Decode가 더 빠른 경우가 확인됐습니다.

실용적 조언

  • 추론 엔진을 비교할 때는 동일한 GPU, CUDA 아키텍처, 모델 파일, 배치 크기, 생성 토큰 수를 맞춰야 합니다. 이 벤치마크는 두 엔진에 같은 CUDA 아키텍처와 2048 배치를 적용하고 128토큰 생성 및 엔진 교대 반복을 사용했습니다. 입력 길이별 Prefill과 Decode를 분리하면 짧은 프롬프트와 긴 컨텍스트에서 나타나는 성능 차이를 구분할 수 있습니다.
  • Speculative decoding을 평가할 때는 Decode 처리량뿐 아니라 드래프터가 프롬프트를 처리하면서 발생시키는 Prefill 감소도 함께 기록해야 합니다. 이 측정에서는 TensorSharp의 Prefill이 60토큰에서 459tok/s에서 341tok/s로, 2050토큰에서 1317tok/s에서 703tok/s로 감소했습니다. 드래프터를 추가한 뒤의 전체 처리 비용을 포함해야 실제 사용 조건에 가까운 비교가 됩니다.

섹션별 상세

작성자는 Meta의 Muse Glimmer 30B Unsloth GGUF 모델을 TensorSharp와 llama.cpp에서 실행하고 동일한 조건의 처리량을 비교했습니다. 테스트에는 NVIDIA RTX PRO 6000 Blackwell Server Edition 한 장, 27.6 GiB 크기의 `Muse-Glimmer-30B-Q8_0.gguf`, 128토큰 생성, 2회 반복 측정이 사용됐습니다. TensorSharp의 Prefill은 짧은 입력 60·501·2050토큰에서 llama.cpp보다 각각 1.27배·1.23배·1.16배 빨랐지만, 16,126토큰부터는 llama.cpp가 1.06배 앞섰고 123,931토큰에서는 TensorSharp가 0.92배 수준이었습니다. Decode는 짧은 60토큰 입력에서 거의 같았고, 긴 입력 123,931토큰에서는 TensorSharp가 26.6tok/s로 llama.cpp의 30.7tok/s보다 낮았습니다.
DFlash speculative decoding에서는 작은 드래프터가 후보 토큰을 먼저 만들고 대상 모델이 검증하는 경로의 성능 차이가 입력 길이에 따라 크게 달라졌습니다. TensorSharp는 60토큰에서 50.9tok/s, 501토큰에서 180.3tok/s로 llama.cpp의 45.5tok/s와 117.5tok/s를 앞섰지만, 16,126토큰에서는 55.8tok/s 대 80.2tok/s로 뒤처졌고 123,931토큰에서도 42.3tok/s 대 69.0tok/s로 낮았습니다. 드래프터 Encoder가 프롬프트를 다시 처리하기 때문에 Prefill 속도도 감소했으며, 2,050토큰에서 TensorSharp는 plain generation의 1317tok/s에서 703tok/s로 줄었습니다. 따라서 speculative decoding의 이점은 Decode 수치만으로 판단하기 어렵고 드래프터의 추가 Prefill 비용을 함께 측정해야 합니다.
작성자는 두 개의 RTX PRO 4000 Blackwell 24GB GPU에서 TensorSharp의 텐서 병렬 실행도 측정했습니다. 30B-UD-IQ2_XXS 모델을 한 GPU에서 실행할 때 Prefill 1171tok/s와 Decode 40.2tok/s였고, `--tp 2`로 두 GPU를 사용하면 각각 1569tok/s와 63.2tok/s가 됐습니다. 두 GPU 구성은 단일 GPU 대비 Prefill 1.34배, Decode 1.57배의 처리량을 기록했으며 GPU 메모리 사용량은 각각 5115MB와 4063MB로 나뉘었습니다. 이 결과는 TensorSharp가 GGUF 로컬 추론뿐 아니라 다중 GPU 텐서 병렬 실행도 측정 대상에 포함한다는 점을 뒷받침합니다.

용어 해설

GGUF 형식(GGUF)
LLM 가중치와 관련 메타데이터를 한 파일에 저장해 로컬 추론 엔진에서 읽을 수 있도록 만든 모델 파일 형식입니다. 이 글에서는 Muse Glimmer 30B의 양자화 가중치와 DFlash 드래프터가 GGUF 파일로 사용됐습니다.
추측 디코딩(Speculative Decoding)
작은 드래프트 모델이 다음 토큰 후보를 먼저 생성하고 큰 대상 모델이 이를 검증해 디코딩 속도를 높이는 방식입니다. 검증 전에 드래프터가 프롬프트를 처리해야 하므로 긴 입력에서는 Prefill 비용이 추가됩니다.
프리필(Prefill)
입력 프롬프트 전체를 모델에 통과시켜 첫 번째 생성 단계에 필요한 KV cache를 만드는 처리 구간입니다. 이 글의 측정에서는 입력 토큰 수가 늘어날수록 TensorSharp와 llama.cpp의 Prefill 처리량 변화를 비교했습니다.
연속 배칭(Continuous Batching)
서로 다른 요청의 처리 단계를 동적으로 묶어 GPU 계산 자원을 계속 활용하는 추론 방식입니다. TensorSharp가 지원하는 기능으로 소개됐지만, 이 벤치마크의 표는 주로 단일 실행의 Prefill과 Decode 속도를 기록합니다.
멀티모달 지원(Multimodal Support)
텍스트뿐 아니라 이미지 같은 여러 입력 형태를 모델 추론 과정에서 처리하는 기능입니다. TensorSharp의 지원 기능 목록에 포함됐지만, 제시된 Muse Glimmer 벤치마크는 plain text generation 측정에 초점을 맞췄습니다.

언급된 도구

TensorSharp추천링크

GGUF LLM을 로컬에서 실행하는 .NET 기반 추론 엔진으로 CUDA, Vulkan, Metal, OpenAI-compatible API, 연속 배칭, speculative decoding, 멀티모달 기능을 지원합니다.

llama.cpp중립

GGUF 모델의 Prefill, Decode, DFlash speculative decoding 성능을 비교하기 위한 기준 추론 엔진으로 사용됐습니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 14.수집 2026. 08. 14.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.