본문으로 건너뛰기

로컬에서 실행할 수 있는 LLM은 무엇인가

VRAM과 컨텍스트, 작업 유형을 맞춰 로컬 LLM의 실행 가능 모델과 속도를 계산하는 방법을 정리합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 글은 GPU VRAM과 메모리 대역폭, 모델의 작업 유형을 기준으로 로컬에서 실행할 LLM을 고르는 계산기의 작동 원리를 설명합니다. Q4_K_M 양자화는 FP16 대비 품질 손실이 1% 미만으로 제시되지만, 긴 컨텍스트에서는 가중치와 별도로 KV cache가 VRAM을 사용하므로 컨텍스트 길이까지 함께 계산해야 합니다. RTX 4090 24GB에서는 Q4_K_M과 8k 컨텍스트로 16개 중 13개 모델이 실행되며, 문서 인식에는 0.6GB의 PaddleOCR-VL 1.6이나 6.0GB의 Qwen3-VL 8B가 후보가 됩니다. 생성 속도는 메모리 대역폭과 활성 파라미터 수에 좌우되고, 실제 운영에서는 데이터 비공개 요구와 토큰 처리량을 기준으로 로컬 GPU의 경제성을 판단해야 합니다.

섹션별 상세

로컬 LLM 선택은 모델 이름보다 GPU 또는 통합 메모리의 용량, 메모리 대역폭, 작업 유형을 먼저 맞추는 문제입니다. 계산기는 하드웨어와 채팅·코딩·문서 인식 같은 목적을 입력으로 받아 적합한 공개 모델, 컨텍스트 길이, 예상 생성 속도, 실행 불가 사유를 함께 계산합니다. 전용 GPU에서는 모델에 약 90%의 메모리를 배정하고 나머지를 컨텍스트와 활성값에 남겨야 하므로, 가중치 크기만 보고 모델을 고르면 실제 실행 단계에서 메모리 부족이 발생할 수 있습니다.
양자화는 16비트 가중치를 더 적은 비트로 저장해 메모리와 메모리 읽기 비용을 줄이는 방식입니다. Q4_K_M은 FP16 대비 측정 Perplexity 손실이 약 0.6% 또는 1% 미만으로 제시되며, 일반적인 채팅과 요약에서는 차이를 알아차리기 어렵지만 엄격한 형식 출력, 긴 산술 계산, 저자원 언어에서 먼저 품질이 떨어집니다. 같은 메모리 예산이라면 작은 모델의 8비트 버전보다 더 큰 모델의 4비트 버전이 대체로 유리하다는 선택 기준이 제시됩니다.
근거
  • Q4_K_M은 FP16 대비 측정 Perplexity 손실이 약 0.6%이며 일반적인 채팅과 요약에서는 차이를 알아차리기 어렵다. 양자화와 컨텍스트 설명에서 Q4_K_M의 약 0.6% 손실과 일반 작업에서의 체감 차이를 설명한 문단
컨텍스트 길이는 모델이 한 번에 볼 수 있는 대화나 문서의 양이며, 가중치와 별도의 KV cache 메모리를 사용합니다. KV cache는 레이어 수, KV head 수, head dimension, 토큰 수에 비례해 커지고, Qwen3.6 27B는 토큰당 64KB를 사용해 256k 컨텍스트에서 16GB가 필요하다고 계산됩니다. Qwen3.6의 Linear Attention, Gemma 4의 짧은 Sliding Window, DeepSeek V4의 캐시 압축처럼 최신 구조는 이 증가량을 줄이며, 지원 런타임에서 8비트 KV cache를 사용하면 캐시 메모리를 다시 절반으로 낮출 수 있습니다.
근거
  • Qwen3.6 27B는 토큰당 64KB의 KV cache를 사용하고 256k 컨텍스트에서 16GB가 필요하다. KV cache 메모리 계산식 다음에 Qwen3.6 27B의 토큰당 사용량과 256k 컨텍스트 비용을 제시한 문단
생성 속도는 FLOPS보다 메모리 대역폭의 영향을 크게 받습니다. 한 토큰을 만들 때 활성 가중치를 메모리에서 읽으므로 카드 대역폭을 가중치 크기로 나누면 이론적 상한을 구할 수 있고, 실제 런타임은 대략 논문상 대역폭의 60%에 도달한다고 가정합니다. Qwen3 30B-A3B처럼 30B 전체 가중치를 저장하지만 토큰마다 3.3B만 활성화하는 MoE 모델은 큰 모델의 메모리를 사용하면서 작은 모델에 가까운 생성 속도를 낼 수 있습니다.
근거
  • Qwen3 30B-A3B는 30B 파라미터를 저장하지만 토큰마다 3.3B만 읽어 작은 모델에 가까운 속도로 실행된다. 생성 속도가 메모리 대역폭에 좌우되는 이유와 MoE 모델의 활성 파라미터를 설명한 문단
24GB VRAM의 RTX 4090에서는 Q4_K_M과 8k 컨텍스트 기준 16개 모델 중 13개가 실행 가능한 것으로 계산됩니다. Qwen3.6 35B-A3B는 약 20GB를 사용하며 약 333 tok/s와 94k 컨텍스트가 제시되고, 문서·비전 작업에는 6.0GB의 Qwen3-VL 8B와 0.6GB의 PaddleOCR-VL 1.6이 후보로 제시됩니다. 반면 gpt-oss 120B는 65.9GB, DeepSeek V4 Flash는 160.4GB가 필요해 단일 RTX 4090의 약 21.6GB 가용 메모리로는 실행되지 않습니다.
근거
  • RTX 4090 24GB에서는 Q4_K_M과 8k 컨텍스트 기준 16개 모델 중 13개가 실행된다. 모델 표 앞의 RTX 4090 24GB 계산 결과 문장
  • PaddleOCR-VL 1.6은 0.6GB 메모리로 문서와 비전 작업을 처리하며 109개 언어를 지원한다. RTX 4090 모델 표의 PaddleOCR-VL 1.6 행과 PDF·스캔 관련 FAQ
로컬 추론이 적합한 상황은 고객 기록·계약서·환자 파일처럼 데이터가 인프라 밖으로 나가면 안 되는 경우와, 일정한 토큰 처리량으로 GPU 비용을 지속적으로 상각할 수 있는 경우입니다. 반대로 사용량이 드물고 변동이 크면 구매한 GPU의 손익분기점에 도달하기 어렵고, 이때는 호스팅 API나 Confidential Computing 기반의 검증 가능한 비공개 추론이 대안이 됩니다. 실제 속도가 예상보다 낮다면 일부 레이어가 시스템 RAM으로 넘어갔는지 확인한 뒤 Flash Attention과 소형 Draft Model을 이용한 Speculative Decoding을 적용하는 순서가 권장됩니다.
근거
  • Flash Attention과 Speculative Decoding을 사용하면 동일한 품질에서 1.5~2배 속도 향상이 가능하다. 예상보다 모델이 느릴 때의 해결책을 설명한 FAQ 문단

용어 해설

양자화(Quantisation)
모델 가중치의 저장 비트 수를 줄여 메모리 사용량과 메모리 읽기 비용을 낮추는 압축 기법입니다. 16비트 가중치를 4비트로 바꾸면 모델 크기가 대략 4분의 1로 줄지만, 정확도 손실이 발생하므로 작업 유형과 허용 가능한 품질 저하를 함께 고려해야 합니다.
KV 캐시(KV cache)
Attention이 이전 토큰의 Key와 Value를 저장해 매 토큰마다 과거 내용을 다시 계산하지 않도록 하는 메모리 영역입니다. 모델 가중치와 별도로 컨텍스트 길이에 따라 증가하므로 긴 문서나 대화에서는 VRAM 부족의 주요 원인이 됩니다.
Mixture of Experts
전체 파라미터를 저장하면서도 각 토큰을 처리할 때 일부 Expert만 활성화하는 모델 구조입니다. 활성 파라미터 수가 작으면 생성 속도는 빠르게 유지하면서 더 큰 모델의 가중치와 메모리를 활용할 수 있습니다.
GGUF
로컬 추론 환경에서 양자화된 모델 가중치를 저장하는 파일 형식입니다. Q4_K_M처럼 평균 비트 수가 다른 형식을 지원하며, Embedding과 Output 레이어를 더 높은 정밀도로 보존하기 때문에 이름의 비트 수보다 실제 메모리 사용량이 조금 커질 수 있습니다.
Flash Attention
Attention 계산과 메모리 접근을 효율화하는 추론 최적화 기법입니다. LM Studio 같은 런타임에서는 KV cache를 8비트로 양자화하는 설정과 함께 사용할 수 있으며, 8비트 캐시는 해당 메모리 사용량을 절반으로 줄이는 방식으로 작동합니다.

기술

  • GGUF
  • Q4_K_M
  • Qwen3.6
  • Qwen3-VL
  • Gemma 4
  • gpt-oss
  • DeepSeek-OCR-2
  • PaddleOCR-VL 1.6
  • LM Studio
  • Ollama
  • Flash Attention
  • KV cache
  • Mixture of Experts
  • Speculative Decoding
  • Confidential Computing

활용 사례

  • 개인 GPU에서 채팅과 코딩 보조
  • PDF·송장·여권·스캔 문서의 로컬 처리
  • 고객 기록과 계약서를 외부 API로 보내지 않는 비공개 추론
  • 24시간 분류·추출·태깅 파이프라인
  • 긴 문서와 대규모 컨텍스트 처리
  • 다수 사용자를 위한 GPU 배치 추론
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 13.수집 2026. 08. 13.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.