TL;DR
NInfer는 RTX 5090과 Blackwell을 중심으로 작성된 C++/CUDA inference engine을 NVIDIA Turing의 sm_75과 22GB 개조 RTX 2080 Ti에 맞춰 포팅하고 튜닝한 프로젝트입니다. 공식 groupwise-int W8A16 artifact와 Q8 KV를 사용하면 표준 autoregressive 추론은 약 25 tok/s를 기록하며, MTP3 speculative decode와 draft window 3에서는 약 65% 수용률로 약 456 tok/s까지 올라갑니다. MTP draft weights를 포함한 VRAM 사용량은 약 17.5 GiB이고 4.5~5.0 GiB가 KV cache에 남아 약 128k context를 처리할 수 있습니다. OpenAI·Anthropic 호환 HTTP serving과 standalone CLI도 함께 제공됩니다.
섹션별 상세
용어 해설
- 추측 디코딩(Speculative Decoding)
- — 작은 draft 모델이 다음 토큰 후보를 먼저 생성한 뒤 주 모델이 여러 후보를 한 번에 검증하는 추론 방식입니다. 후보가 일정 비율로 수용되면 주 모델의 순차적 디코딩 횟수가 줄어들어 토큰 생성 속도가 크게 높아집니다.
- 그룹 단위 정수 양자화(groupwise-int)
- — 가중치를 그룹별 정수 표현으로 변환해 모델 메모리 사용량을 줄이는 양자화 형식입니다. 이 글에서는 공식 W8A16 artifact를 사용해 RTX 2080 Ti의 제한된 VRAM 안에 기본 모델과 MTP draft 가중치를 함께 적재했습니다.
- Q8 KV 캐시(Q8 KV cache)
- — Transformer가 대화 문맥의 Key와 Value를 8비트 정수로 저장하는 메모리 절감 방식입니다. NInfer는 draft 가중치를 적재한 뒤에도 약 4.5~5.0 GiB를 KV cache에 남겨 약 128k context를 처리하도록 구성했습니다.
- MTP3
- — 추론 과정에서 여러 미래 토큰을 미리 제안하는 멀티 토큰 예측 설정입니다. 이 구현에서는 draft window를 3으로 두고 약 65%의 후보 수용률을 기록했으며, 표준 autoregressive 경로보다 높은 처리량을 얻는 데 사용했습니다.
언급된 도구
C++/CUDA 기반 단일 GPU inference engine과 OpenAI·Anthropic 호환 HTTP serving을 제공하며 RTX 2080 Ti의 추론을 처리합니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.