본문으로 건너뛰기

LLM 모델명 해독 가이드

LLM 파일명의 파라미터·활성량·Quantization·파일 형식을 읽는 법

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

로컬 LLM 파일명은 모델 계열, 총 파라미터 수, 토큰당 활성 파라미터, 학습 방식, 저장 정밀도, Quantization 수준과 파일 형식을 한 줄에 압축해 담습니다. 35B-A3B처럼 표기된 MoE 모델은 총 35B 파라미터를 보유하지만 토큰마다 약 3B만 활성화하며, 35B 모델 전체를 매번 계산하는 Dense 모델과 처리 방식이 다릅니다. FP16 weight는 35B 모델에서 약 70GB를 차지하지만 Q4급 Quantization을 적용하면 약 18GB 수준으로 줄어들 수 있어 로컬 실행에 필요한 메모리가 감소합니다. Q4_K_M의 K와 M은 특정 Quantization scheme과 변형을 가리키고, GGUF는 모델을 저장하는 파일 형식을 뜻하므로 파일명을 왼쪽부터 읽으면 모델 선택에 필요한 사양을 파악할 수 있습니다.

섹션별 상세

01
로컬 LLM 파일명에 붙는 7B, 14B, 35B, 70B의 B는 모델이 학습한 파라미터의 총 개수를 뜻하며, 파라미터가 많을수록 일반적으로 실행에 더 많은 메모리가 필요합니다. 다만 총 파라미터 수만으로 토큰 생성 때의 계산량을 판단할 수는 없습니다. Dense 모델은 거의 전체 파라미터를 토큰마다 사용하지만 MoE 모델은 여러 expert 중 일부를 선택하므로 같은 총 규모라도 실제 처리 방식이 달라집니다.
7B, 13B, 70B+처럼 서로 다른 LLM 파라미터 규모를 장치와 사용 환경에 대응시킨 그래픽입니다.
Infographic이미지는 파라미터 수가 모델 규모를 나타내며 모델을 실행할 때 필요한 자원과 연결된다는 기사의 설명을 보조합니다. 기사 본문은 7B·14B·35B·70B를 예로 들고, 파라미터가 많을수록 일반적으로 더 많은 메모리가 필요하다고 설명합니다.
Qwen-1.8B, Qwen-7B, Qwen-14B, Qwen-72B의 Embeddings, Transformer Layers와 LM Head별 파라미터 분포를 누적 막대로 비교한 차트입니다.
Chart모델 규모가 커질수록 구성 요소별 파라미터가 어떻게 증가하는지 Qwen 계열별로 보여줍니다. 기사에서 7B·14B·70B 같은 숫자가 총 파라미터 수를 뜻한다고 설명한 부분과 연결되지만, 차트의 모델명과 수치는 본문 예시와 별도로 읽어야 합니다.
02
35B-A3B 표기에서 35B는 사용 가능한 총 파라미터 수이고 A3B는 토큰마다 활성화되는 약 3B 파라미터를 뜻합니다. MoE의 routing mechanism이 입력 토큰에 맞는 expert를 골라 전체 파라미터 풀에서 일부만 계산에 투입합니다. 따라서 35B-A3B를 3B 모델로 간주하면 안 되며, 35B Dense 모델과 비교할 때 총 저장 용량과 토큰당 계산량을 나누어 봐야 합니다.
Qwen3.5-35B-A3B-GPTQ-Int4라는 모델명을 모델 계열, 총 35B 규모, 3B 활성량, GPTQ Quantization 방식과 4-bit 정밀도로 나누어 표시한 도식입니다.
Infographic기사에서 다룬 모델명 해독 방식을 한 사례에 적용해 각 토큰이 무엇을 의미하는지 시각적으로 연결합니다. 특히 총 파라미터와 활성 파라미터, Quantization 방식과 정밀도를 별도 항목으로 나누어 표기의 역할을 구분합니다.
MoE 모델의 Router가 입력을 특정 expert로 보내고 결과를 출력으로 연결하는 흐름을 나타낸 다이어그램입니다.
Diagram입력 토큰이 모든 expert를 거치지 않고 Router의 선택을 통해 일부 expert로 전달되는 MoE의 핵심 처리 구조를 보여줍니다. 이 흐름은 MoE가 큰 총 파라미터 풀을 유지하면서 토큰마다 일부 파라미터만 활성화하는 이유와 A3B 표기를 이해하는 데 직접 연결됩니다.
03
Base와 Instruct는 모델 크기나 Quantization이 아니라 사전 학습 이후의 튜닝 방식을 구분하는 표기입니다. Base model은 학습 데이터의 패턴을 바탕으로 텍스트를 생성하고, Instruct model은 instruction tuning을 거쳐 명령 수행과 대화형 응답에 맞게 조정됩니다. 예를 들어 35B-A3B-Base-Q4와 35B-A3B-Instruct-Q4는 같은 4-bit 수준으로 저장될 수 있지만, 일반적인 챗봇 사용에는 Instruct 버전이 더 적합합니다.
Base model이 Reasoning과 Fast Response 단계를 거쳐 Instruct Model-SFT 및 Instruct Model-KD로 이어지는 학습 흐름도입니다.
DiagramBase model 이후 SFT와 Offline On-policy Distillation 경로를 거쳐 Instruct Model이 만들어지는 과정을 나타냅니다. 기사에서 Base model과 Instruct model의 차이를 추가 학습 여부로 구분한 내용과 맞닿아 있으며, Instruct 표기가 모델 행동 방식을 가리킨다는 점을 보조합니다.
04
FP16과 BF16은 모두 값 하나를 16비트로 저장하지만 exponent와 fraction의 배분이 달라 정밀도와 숫자 범위가 다릅니다. 35B 파라미터를 16비트로 저장하면 weight만 약 70GB가 필요하므로 소비자용 장치에서 부담이 커집니다. Quantization은 Q8, Q6, Q5, Q4, Q3처럼 더 적은 비트로 weight를 저장해 메모리를 줄이며, 35B 모델은 16비트의 약 70GB에서 4-bit 수준의 약 18GB로 줄어들 수 있지만 실제 크기는 metadata와 scheme에 따라 달라집니다.
05
Q4_K_M에서 Q4는 4-bit급 Quantization을, K와 M은 특정 grouping·scale·precision 조합과 그 변형을 가리킵니다. Q4_K_M과 Q6_K를 비교할 때는 단순히 비트 수뿐 아니라 서로 다른 Quantization scheme도 함께 고려해야 합니다. GGUF는 이 정보들과 weight를 소프트웨어가 읽을 수 있도록 묶는 model file format이며, Qwen3-30B-A3B-Instruct-2507-q2ks-mixed-AutoRound-gguf 같은 이름은 모델 계열, 파라미터, 활성량, 튜닝 방식, 버전 식별자, Quantization, 혼합 비트 폭, 알고리즘과 파일 형식을 순서대로 담습니다.
Q4_K_M을 Q, 4, K, M으로 나누어 Quantized weight, 약 4비트, K-quant 계열과 Medium variant를 각각 표시한 도식입니다.
InfographicQ4_K_M의 각 기호가 Quantization 여부, 비트 수, scheme 계열과 variant를 어떻게 가리키는지 한눈에 보여줍니다. Q5_K_S와 IQ4_XS, Q8_0 사례도 함께 제시해 K-quant 변형과 legacy scheme이 서로 다른 표기 체계를 가질 수 있음을 보조합니다.

용어 해설

Mixture-of-Experts(Mixture-of-Experts (MoE))
전체 파라미터를 여러 expert로 나누고 입력 토큰마다 routing mechanism이 일부 expert를 선택하는 모델 구조입니다. 전체 파라미터 규모는 크게 유지하면서 토큰 처리에 실제로 사용하는 파라미터와 계산량을 줄이는 데 활용됩니다.
활성 파라미터(Activated Parameters)
MoE 모델이 토큰 하나를 처리할 때 실제 계산에 참여하는 파라미터 수입니다. 모델 이름의 A3B처럼 표시되며, 총 파라미터 수와 구별해야 모델의 메모리 요구량과 추론 계산량을 올바르게 판단할 수 있습니다.
Instruction Tuning
사전 학습을 마친 Base model을 사용자 지시를 따르고 대화형 작업을 수행하도록 추가 학습하는 과정입니다. 같은 구조와 파라미터 수를 가진 모델이라도 Base와 Instruct 사이에 상호작용 방식의 차이가 생깁니다.
Quantization
모델 weight를 FP16이나 BF16보다 적은 비트로 저장해 파일 크기와 메모리 사용량을 줄이는 기법입니다. Q4, Q5, Q6, Q8처럼 비트 수준을 나타내며, 비트 수가 낮아질수록 메모리는 줄지만 모델 품질이 일부 낮아질 수 있습니다.
GGUF 파일 형식(GGUF)
로컬 LLM weight와 관련 정보를 소프트웨어가 읽을 수 있도록 묶어 저장하는 model file format입니다. GGUF 자체는 quantization 수준이 아니라 파일의 포장·저장 형식을 나타내므로 Q4나 Q8 같은 표기와 구분해야 합니다.

기술

  • Qwen3.5
  • Qwen3
  • MoE
  • FP16
  • BF16
  • Q4_K_M
  • Q6_K
  • Q8_0
  • GGUF
  • AutoRound

활용 사례

  • 로컬 LLM 파일 선택
  • 소비자용 장치의 모델 메모리 요구량 판단
  • 챗봇용 Base·Instruct 모델 비교
  • Quantization 수준에 따른 품질·용량 절충
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 02.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.