본문으로 건너뛰기

NInfer의 RTX 2080 Ti 추론 최적화

NInfer가 22GB 개조 RTX 2080 Ti에서 speculative decode로 약 456 tok/s를 기록했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

NInfer는 RTX 5090과 Blackwell을 중심으로 작성된 C++/CUDA inference engine을 NVIDIA Turing의 sm_75과 22GB 개조 RTX 2080 Ti에 맞춰 포팅하고 튜닝한 프로젝트입니다. 공식 groupwise-int W8A16 artifact와 Q8 KV를 사용하면 표준 autoregressive 추론은 약 25 tok/s를 기록하며, MTP3 speculative decode와 draft window 3에서는 약 65% 수용률로 약 456 tok/s까지 올라갑니다. MTP draft weights를 포함한 VRAM 사용량은 약 17.5 GiB이고 4.5~5.0 GiB가 KV cache에 남아 약 128k context를 처리할 수 있습니다. OpenAI·Anthropic 호환 HTTP serving과 standalone CLI도 함께 제공됩니다.

섹션별 상세

NInfer는 RTX 5090과 Blackwell을 기준으로 처음부터 작성한 C++/CUDA inference engine을 NVIDIA Turing의 sm_75 아키텍처로 포팅한 구현입니다. 특히 22GB로 개조한 RTX 2080 Ti를 대상으로 커널과 실행 경로를 조정했습니다. 범용적인 호환성 주장보다 특정 GPU 세대와 VRAM 구성에 맞춘 최적화 사례라는 점이 핵심입니다.
공식 groupwise-int W8A16 artifact와 Q8 KV를 사용한 표준 autoregressive 경로는 약 25 tok/s를 기록했습니다. MTP3와 draft window 3을 적용한 speculative decode에서는 약 65%의 후보 수용률과 함께 약 456 tok/s를 기록해 두 실행 방식 사이에 큰 처리량 차이가 났습니다. MTP draft weights를 적재한 전체 VRAM 사용량은 약 17.5 GiB였고, 남은 약 4.5~5.0 GiB를 KV cache에 할당해 약 128k context를 수용했습니다.
이 엔진은 단순한 로컬 CLI에 그치지 않고 OpenAI와 Anthropic 호환 HTTP serving을 함께 제공합니다. `/v1/chat/completions` endpoint, streaming, function calling을 지원하며 standalone CLI도 포함합니다. 따라서 RTX 2080 Ti에서의 단일 GPU 추론 실험을 애플리케이션 연동까지 확장할 수 있는 형태로 저장소와 빌드 지침이 공개됐습니다.

용어 해설

추측 디코딩(Speculative Decoding)
작은 draft 모델이 다음 토큰 후보를 먼저 생성한 뒤 주 모델이 여러 후보를 한 번에 검증하는 추론 방식입니다. 후보가 일정 비율로 수용되면 주 모델의 순차적 디코딩 횟수가 줄어들어 토큰 생성 속도가 크게 높아집니다.
그룹 단위 정수 양자화(groupwise-int)
가중치를 그룹별 정수 표현으로 변환해 모델 메모리 사용량을 줄이는 양자화 형식입니다. 이 글에서는 공식 W8A16 artifact를 사용해 RTX 2080 Ti의 제한된 VRAM 안에 기본 모델과 MTP draft 가중치를 함께 적재했습니다.
Q8 KV 캐시(Q8 KV cache)
Transformer가 대화 문맥의 Key와 Value를 8비트 정수로 저장하는 메모리 절감 방식입니다. NInfer는 draft 가중치를 적재한 뒤에도 약 4.5~5.0 GiB를 KV cache에 남겨 약 128k context를 처리하도록 구성했습니다.
MTP3
추론 과정에서 여러 미래 토큰을 미리 제안하는 멀티 토큰 예측 설정입니다. 이 구현에서는 draft window를 3으로 두고 약 65%의 후보 수용률을 기록했으며, 표준 autoregressive 경로보다 높은 처리량을 얻는 데 사용했습니다.

언급된 도구

NInfer추천링크

C++/CUDA 기반 단일 GPU inference engine과 OpenAI·Anthropic 호환 HTTP serving을 제공하며 RTX 2080 Ti의 추론을 처리합니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 21.수집 2026. 08. 21.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.