본문으로 건너뛰기
r/LocalLLaMA조회 1

Qwen3.8-27B-NInfer의 컨텍스트별 추론 속도

RTX 5090에서 Qwen3.8-27B-NInfer는 200k 이상 컨텍스트에서도 143.7 tok/s를 기록했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 Codex에서 Qwen3.8-27B-NInfer를 7시간 동안 단일 세션으로 실행한 서버 로그를 바탕으로 컨텍스트 크기별 median decode 속도를 측정했습니다. RTX 5090에서 KV cache를 q8로 설정하고 컨텍스트 길이를 최대로 확장한 결과, 프롬프트 크기가 50k 미만일 때 169.7 tok/s였고 200k 이상에서도 143.7 tok/s를 기록했습니다. 단일 요청의 최대 decode 속도는 222.0 tok/s, 5초 지속 기준 최대 속도는 211.2 tok/s였으며, 작성자는 긴 문맥에서의 성능 저하가 예상보다 작다고 평가했습니다.

실용적 조언

  • 긴 Codex 세션에서 컨텍스트 증가에 따른 처리량 변화를 확인하려면 서버 로그를 구간별로 수집하고 median decode 속도를 비교하는 방식이 유용합니다. 프롬프트 크기를 50k 단위로 나누면 문맥 길이에 따른 속도 저하를 한눈에 확인할 수 있습니다. 다만 이 글의 수치는 단일 세션과 특정 GPU, q8 KV cache 설정에 기반하므로 다른 환경과 직접 비교할 때는 동일한 조건을 맞춰야 합니다.

섹션별 상세

작성자는 Codex에서 모델을 7시간 동안 실행한 단일 세션의 서버 로그를 ChatGPT에 전달하고, 로그에서 수치를 추출하는 스크립트를 작성하게 했습니다. 측정 대상은 컨텍스트 크기에 따른 median decode 속도였으며, 단순 체감이 아니라 로그에서 추출한 수치로 비교했습니다. AI 모델의 장시간 코딩 세션에서 문맥 증가가 실제 생성 처리량에 미치는 영향을 확인하려는 사례입니다.
Qwen3.8-27B-NInfer는 프롬프트 크기가 50k 미만일 때 169.7 tok/s를 기록했고, 50–100k에서는 167.6 tok/s, 100–150k에서는 156.9 tok/s로 낮아졌습니다. 150–200k 구간에서는 149.0 tok/s, 200k 이상에서는 143.7 tok/s였으므로 문맥이 커질수록 속도는 감소하지만 200k 이상에서도 143.7 tok/s를 유지했습니다. 작성자는 컨텍스트 증가에 따른 성능 저하가 예상보다 크지 않았다고 평가했습니다.
작성자가 직접 조정한 설정은 KV cache를 q8로 지정하고 컨텍스트 길이를 최대로 확장한 것이었습니다. 단일 요청의 최대 decode 속도는 222.0 tok/s, 5초 동안 지속된 최대 decode 속도는 211.2 tok/s였으며, 서버는 여러 요청을 처리할 수 있는 동시성 설정을 사용했습니다. 하드웨어는 언더볼팅이나 오버클러킹을 하지 않은 RTX 5090이었습니다.

용어 해설

KV 캐시(KV cache)
Transformer가 이전 토큰의 Key와 Value를 저장해 긴 문맥을 처리할 때 중복 계산을 줄이는 메모리 구조입니다. 이 글에서는 KV cache 정밀도를 q8로 설정해 메모리 사용량과 추론 속도 사이의 균형을 맞췄습니다.
컨텍스트 길이(Context Length)
모델이 한 번의 요청에서 입력과 이전 대화를 함께 처리할 수 있는 최대 토큰 수입니다. 글에서는 컨텍스트 길이를 최대로 설정한 뒤 입력 규모가 커질 때 decode 속도가 어떻게 변하는지 측정했습니다.
디코드 속도(Decode Speed)
모델이 입력을 처리한 뒤 새로운 토큰을 생성하는 속도이며 tok/s로 측정합니다. 이 글의 수치는 요청 처리 중 생성 단계의 속도를 나타내며 문맥이 길어질수록 중앙값이 낮아지는 흐름을 담고 있습니다.
동시성(Concurrency)
여러 요청을 동시에 처리하도록 추론 서버가 작업을 배분하는 설정입니다. 작성자는 다중 요청을 처리할 수 있게 설정했지만, 제시한 측정값은 여러 요청을 섞지 않은 단일 Codex 세션에서 얻었습니다.
8비트 양자화(q8)
가중치나 캐시 값을 8비트 수준으로 표현해 메모리 사용량을 줄이는 정밀도 설정입니다. 이 글에서는 모델 자체의 다른 설정은 거의 건드리지 않고 KV cache에 q8을 적용한 조건에서 속도를 측정했습니다.

언급된 도구

Codex중립

장시간 단일 세션에서 모델을 실행하는 코딩 작업 환경

ChatGPT중립

서버 로그에서 성능 수치를 추출하는 스크립트 작성

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 19.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.