TL;DR
로컬 LLM 파일명은 모델 계열, 총 파라미터 수, 토큰당 활성 파라미터, 학습 방식, 저장 정밀도, Quantization 수준과 파일 형식을 한 줄에 압축해 담습니다. 35B-A3B처럼 표기된 MoE 모델은 총 35B 파라미터를 보유하지만 토큰마다 약 3B만 활성화하며, 35B 모델 전체를 매번 계산하는 Dense 모델과 처리 방식이 다릅니다. FP16 weight는 35B 모델에서 약 70GB를 차지하지만 Q4급 Quantization을 적용하면 약 18GB 수준으로 줄어들 수 있어 로컬 실행에 필요한 메모리가 감소합니다. Q4_K_M의 K와 M은 특정 Quantization scheme과 변형을 가리키고, GGUF는 모델을 저장하는 파일 형식을 뜻하므로 파일명을 왼쪽부터 읽으면 모델 선택에 필요한 사양을 파악할 수 있습니다.
섹션별 상세






용어 해설
- Mixture-of-Experts(Mixture-of-Experts (MoE))
- — 전체 파라미터를 여러 expert로 나누고 입력 토큰마다 routing mechanism이 일부 expert를 선택하는 모델 구조입니다. 전체 파라미터 규모는 크게 유지하면서 토큰 처리에 실제로 사용하는 파라미터와 계산량을 줄이는 데 활용됩니다.
- 활성 파라미터(Activated Parameters)
- — MoE 모델이 토큰 하나를 처리할 때 실제 계산에 참여하는 파라미터 수입니다. 모델 이름의 A3B처럼 표시되며, 총 파라미터 수와 구별해야 모델의 메모리 요구량과 추론 계산량을 올바르게 판단할 수 있습니다.
- Instruction Tuning
- — 사전 학습을 마친 Base model을 사용자 지시를 따르고 대화형 작업을 수행하도록 추가 학습하는 과정입니다. 같은 구조와 파라미터 수를 가진 모델이라도 Base와 Instruct 사이에 상호작용 방식의 차이가 생깁니다.
- Quantization
- — 모델 weight를 FP16이나 BF16보다 적은 비트로 저장해 파일 크기와 메모리 사용량을 줄이는 기법입니다. Q4, Q5, Q6, Q8처럼 비트 수준을 나타내며, 비트 수가 낮아질수록 메모리는 줄지만 모델 품질이 일부 낮아질 수 있습니다.
- GGUF 파일 형식(GGUF)
- — 로컬 LLM weight와 관련 정보를 소프트웨어가 읽을 수 있도록 묶어 저장하는 model file format입니다. GGUF 자체는 quantization 수준이 아니라 파일의 포장·저장 형식을 나타내므로 Q4나 Q8 같은 표기와 구분해야 합니다.
기술
- Qwen3.5
- Qwen3
- MoE
- FP16
- BF16
- Q4_K_M
- Q6_K
- Q8_0
- GGUF
- AutoRound
활용 사례
- 로컬 LLM 파일 선택
- 소비자용 장치의 모델 메모리 요구량 판단
- 챗봇용 Base·Instruct 모델 비교
- Quantization 수준에 따른 품질·용량 절충
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.