본문으로 건너뛰기

Paddock NVIDIA GPU 추론 엔진

Paddock이 Qwen benchmark에서 vLLM과 llama.cpp를 앞선 수치를 공개했다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Paddock은 Rust와 자체 CUDA kernels로 구현된 NVIDIA GPU용 inference engine으로, GPU마다 모델 하나를 배치하고 Tensor Parallelism 없이 메모리 대역폭을 활용한다. 공개 Qwen3.6-27B benchmark에서 32개 동시 클라이언트 기준 TTFT 697ms를 기록해 vLLM의 2.5초와 llama.cpp의 6.9초보다 짧았으며, 13개 시나리오 중 각각 11개와 13개에서 앞섰다. 0.1.2 릴리스의 speculative decoding은 RTX PRO 6000에서 Qwen3.8-27B Q8 단일 스트림 속도를 46.8 tok/s에서 202 tok/s로 높였지만, 비교 결과는 Blackwell 중심이며 일부 경쟁 엔진 수치는 저장된 실행 결과다. 무료이지만 open source는 아니고, OpenAI 및 Anthropic 호환 API와 Studio를 통해 모델 다운로드·실행·비교를 한 번에 처리한다.

섹션별 상세

01
Paddock은 Rust로 처음부터 작성한 엔진과 자체 CUDA kernels를 사용하며, NVIDIA driver 580 이상만 필요한 binary와 data folder 형태로 배포된다. GPU마다 모델 하나를 배치하고 Tensor Parallelism을 사용하지 않아 각 GPU의 메모리 대역폭을 직접 활용하는 구조다. OpenAI 및 Anthropic 호환 엔드포인트와 embeddings, reranking, speech to text를 함께 제공하며, 작성자는 이 구성이 단일 GPU 장애의 영향 범위를 제한한다고 밝혔다.
02
공개 Qwen3.6-27B benchmark에서 32개 동시 클라이언트 기준 Paddock의 TTFT는 697ms였고, vLLM은 2.5초, llama.cpp는 6.9초였다. 전체 13개 시나리오에서는 vLLM을 상대로 11개, llama.cpp를 상대로 13개 시나리오에서 더 높은 결과를 기록했다. 작성자는 하드웨어, quant, flags를 methodology page에 공개해 재현 가능한 비교를 지향한다고 밝혔다.
03
0.1.2 릴리스는 speculative decoding stack을 MTP와 DFlash draft designs까지 확장했다. 같은 엔진과 같은 RTX PRO 6000에서 Qwen3.8-27B Q8의 속도는 speculation을 끄면 단일 스트림 46.8 tok/s, 8개 동시 대화 320 tok/s, 32개 동시 대화 1005 tok/s였고, 켜면 각각 202, 822, 1285 tok/s로 측정됐다. 이 수치는 다른 엔진과의 비교가 아니라 Paddock 내부 baseline과의 비교라는 조건이 붙는다.
04
vLLM과 SGLang의 저장된 실행 결과를 포함한 59개 regression cell 중 Paddock은 50개에서 더 높은 결과를 기록했다. 반대로 vLLM의 NVFP4 long-context lane은 Nemotron과 32개 클라이언트 조건에서 16% 앞섰고, Paddock의 batched audio path는 높은 동시성에서 vLLM보다 뒤처졌다. 비교 대상이 같은 날 재실행된 값이 아니라 provenance가 기록된 저장 실행 결과이므로, 작성자는 독립적인 재측정을 요청했다.
05
Paddock의 빠른 경로는 Blackwell GPU를 우선 대상으로 하며 5090과 RTX PRO 6000에서 제시된 수치가 관찰되고 Ampere가 지원 하한선이다. 오래된 GPU에서는 성능 향상 폭이 작을 수 있다. 제품은 개인과 기업이 무료로 사용할 수 있지만 open source는 아니며, 버전별로 영구 사용권과 사용량 제한 없음이 제공된다고 밝혔다.
06
Paddock은 archive를 풀고 `paddock`을 실행하면 Studio가 시작되고 starter model을 가져온 뒤 serving을 시작하는 설치 흐름을 제공한다. Studio 안에서 모델 다운로드, 실행, 비교가 가능해 별도의 복잡한 배포 단계 없이 추론 엔진과 모델 관리 기능을 함께 사용할 수 있다. 작성자는 다음에 성능표에 추가할 consumer GPU와 아직 측정하지 않은 workload를 커뮤니티에 물었다.

용어 해설

추측 디코딩(Speculative Decoding)
초안 생성기가 다음 토큰 후보를 빠르게 만들고 대상 모델이 이를 한꺼번에 검증하는 추론 최적화 기법이다. 검증 결과를 통과한 토큰을 묶어 출력하면 대상 모델의 순차적 디코딩 횟수가 줄어들어 단일 스트림과 동시 요청 처리량을 높일 수 있다.
Tensor Parallelism
하나의 모델 가중치와 연산을 여러 GPU에 나눠 처리하는 병렬화 방식이다. Paddock은 이 구조 대신 GPU마다 모델 하나를 배치해 메모리 대역폭을 전부 활용하고, 한 장의 GPU 장애가 다른 모델의 서비스에 미치는 영향을 줄이는 설계를 택했다.
첫 토큰 지연 시간(TTFT)
요청을 받은 뒤 첫 번째 출력 토큰이 생성될 때까지 걸리는 시간이다. 동시 사용자가 많은 환경에서 초기 응답성을 평가하는 지표로 쓰이며, Paddock은 Qwen3.6-27B와 32개 동시 클라이언트 조건에서 697ms를 기록했다고 밝혔다.
Multi-Token Prediction(MTP)
한 번의 추론 단계에서 여러 미래 토큰을 예측하도록 설계된 방식이다. Paddock의 0.1.2 릴리스에서는 MTP와 DFlash draft designs를 포함한 speculative decoding 구성이 완료됐으며, 추측 디코딩을 켠 조건의 토큰 생성 속도 비교에 사용됐다.
검색 결과 재순위화(Reranking)
검색 시스템이 1차로 가져온 문서나 후보를 별도의 평가 모델로 다시 점수화해 순서를 조정하는 처리 단계다. Paddock은 언어 모델 추론뿐 아니라 embeddings, reranking, speech to text 엔드포인트도 함께 제공한다고 밝혔다.

언급된 도구

Paddock추천

Rust와 자체 CUDA kernels로 구현된 NVIDIA GPU용 language model inference engine이며, 호환 API와 Studio를 제공한다.

vLLM중립

Paddock benchmark에서 TTFT와 여러 regression scenario의 비교 대상으로 사용된 inference engine이다.

llama.cpp중립

Qwen3.6-27B benchmark에서 Paddock의 TTFT 및 시나리오별 성능과 비교된 inference tool이다.

SGLang중립

Paddock의 59개 regression cell 비교에서 경쟁 대상 중 하나로 포함된 inference engine이다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.