본문으로 건너뛰기

전문 용어 없이 배우는 LLM의 구조와 파일 형식

Open Weights, Distillation, Quantization, MoE를 모델 파일과 메모리 계산으로 풀어쓴 입문 안내서입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 글은 Hugging Face 모델 이름에 등장하는 Open Weights, Distillation, Quantization, MoE, Active Parameters와 FP16·Q4·GGUF 같은 용어를 모델의 구성과 실행 방식에 연결해 설명합니다. Open-weight 모델은 가중치를 내려받아 직접 실행할 수 있지만 코드와 학습 데이터까지 공개된 Open Source와는 범위가 다릅니다. Distillation은 큰 Teacher가 만든 합성 데이터로 작은 Student가 행동과 추론 패턴을 배우는 과정이고, Quantization은 같은 모델의 가중치를 적은 비트로 표현해 메모리를 줄이는 과정입니다. MoE는 Router가 토큰마다 일부 Expert만 활성화해 연산량을 줄이지만 전체 파라미터를 저장해야 하므로 671B 전체와 37B 활성 모델은 4비트에서도 약 336GB가 필요합니다. 따라서 모델을 평가할 때 파라미터 수만 보지 말고 구조, 활성 규모, 정밀도, 제작 방식을 함께 확인해야 합니다.

실용적 조언

  • Hugging Face에서 모델을 고를 때는 Dense인지 MoE인지, 전체 파라미터와 활성 파라미터가 각각 얼마인지, 정밀도나 양자화 방식이 무엇인지 확인해야 합니다. 전체 파라미터는 모델의 용량을 가늠하게 하고 활성 파라미터는 MoE에서 토큰당 계산 규모를 가늠하게 합니다. 두 수치를 같은 의미로 비교하면 메모리 요구량과 추론 비용을 잘못 판단할 수 있습니다.
  • 파일명에 `Q4`, `Q5`, `Q6`, `Q8`이 있으면 대체로 파라미터당 비트 수와 관련된 양자화 수준으로 읽을 수 있습니다. 비트 수가 줄면 메모리는 감소하지만 양자화 오차가 커지고 모델 품질이 낮아질 가능성이 있으므로, 로컬 실행 환경의 메모리와 필요한 품질 사이에서 선택해야 합니다. `GGUF`는 파일 형식이고 `Q4_K_M`은 그 안의 양자화 방식과 변형을 나타내므로 둘을 모델 자체의 이름으로 오해하지 않는 편이 좋습니다.
  • 모델의 7B, 70B, 671B 같은 숫자를 지능 순위로 해석하지 않아야 합니다. 글은 최신 14B 모델이 일부 작업에서 오래된 70B 모델보다 나을 수 있고, Distillation 모델이 특정 벤치마크에서 더 큰 모델을 앞설 수 있다고 설명합니다. 모델을 비교할 때는 파라미터 수뿐 아니라 제작 방식, 작업별 성능, MoE의 활성 규모와 양자화 수준을 함께 확인해야 합니다.

섹션별 상세

01
글은 Hugging Face에서 모델 이름을 읽을 때 Open Weights와 Open Source를 같은 뜻으로 받아들이기 어렵다는 점에서 출발합니다. Open-weight 모델은 학습된 가중치를 내려받아 자체 하드웨어에서 실행할 수 있지만, Open Source에 가까운 시스템은 가중치뿐 아니라 관련 코드와 재현에 필요한 정보까지 포함해야 합니다. 글은 `config.json`, tokenizer 파일, 여러 개의 `.safetensors` 파일, inference code, 평가 결과, 라이선스와 학습 정보를 공개 가능한 산출물로 나누어 설명하며, 가중치 공개만으로 학습 데이터와 전체 제작 과정이 재현되는 것은 아니라고 정리합니다.
02
글은 Knowledge Distillation을 큰 Teacher 모델의 행동을 작은 Student 모델로 옮기는 과정으로 설명합니다. 500B Teacher가 질문에 대한 답변이나 수학 문제의 추론 과정을 대량으로 생성하면, 이 합성 데이터로 20B Student를 학습해 Teacher의 가중치를 복사하지 않고 자체 내부 표현과 문제 해결 패턴을 형성하게 합니다. Fine-tuning이 기존 모델을 특정 데이터에 맞추는 과정이라면 Distillation은 큰 모델이 만든 행동 예시로 더 작은 모델을 학습하는 과정이며, 두 방법을 함께 적용할 수도 있습니다.
03
양자화는 모델을 다른 모델로 바꾸는 Distillation과 달리 동일한 가중치를 더 적은 비트로 표현해 메모리 사용량을 줄이는 방식입니다. 7B 모델은 파라미터당 32비트일 때 약 28GB, 16비트일 때 약 14GB, 8비트일 때 약 7GB, 약 4비트일 때 약 3.5GB가 필요하며 실제 파일에는 추가 오버헤드가 붙습니다. GPTQ는 GPU 추론에 흔히 쓰이는 사후 양자화 방식이고 AWQ는 모델 행동에 중요한 가중치를 보존하려 하며, GGUF는 llama.cpp 기반 소프트웨어에서 널리 쓰이는 파일 형식으로 소개됩니다.
04
MoE는 전체 파라미터와 토큰당 활성 파라미터를 분리해서 이해하게 만드는 구조입니다. Dense 70B 모델은 토큰마다 대략 전체 파라미터를 사용하지만, MoE 모델은 Router가 여러 Expert 중 일부만 골라 계산하므로 671B 전체 파라미터와 37B 활성 파라미터를 동시에 가질 수 있습니다. 그러나 671B 파라미터 전체를 저장해야 하므로 4비트에서도 약 336GB가 필요하며, 활성 파라미터가 작다는 사실은 연산량을 낮출 뿐 메모리 문제를 해결하지 않습니다.

용어 해설

오픈 웨이트(Open Weights)
모델의 학습된 가중치를 내려받아 직접 실행할 수 있도록 공개하는 방식입니다. API 결과만 제공하는 폐쇄형 모델과 달리 사용자가 자체 서버나 워크스테이션에서 추론할 수 있지만, 학습 코드·데이터·재현 절차까지 공개된 오픈 소스와는 범위가 다를 수 있습니다.
지식 증류(Knowledge Distillation)
큰 Teacher 모델이 생성한 답변과 문제 해결 과정을 합성 학습 데이터로 만들고, 작은 Student 모델이 이를 학습하는 기법입니다. Student는 Teacher의 가중치를 복사하지 않고 Teacher의 행동 패턴을 자신의 가중치에 근사하므로 모델 규모를 줄이면서 특정 능력을 이전할 수 있습니다.
양자화(Quantization)
신경망 가중치를 FP16이나 FP32 같은 높은 정밀도 대신 INT8, Q4처럼 더 적은 비트로 표현하는 최적화 기법입니다. 저장 가능한 값의 수가 줄어 수치 정밀도와 일부 품질을 잃을 수 있지만, 70B 모델의 메모리 요구량을 FP16 약 140GB에서 4비트 약 35GB로 낮출 수 있습니다.
전문가 혼합 모델(Mixture of Experts)
여러 Expert와 Router로 구성된 희소 모델 구조입니다. Router가 입력 토큰마다 일부 Expert만 선택해 계산하므로 전체 파라미터 풀이 크더라도 토큰당 활성 파라미터와 연산량을 줄일 수 있습니다. 다만 전체 Expert 가중치를 저장해야 하므로 메모리 요구량은 여전히 큽니다.
활성 파라미터(Active Parameters)
MoE 모델에서 특정 토큰을 처리할 때 실제 계산에 참여하는 파라미터의 규모입니다. 전체 파라미터가 671B이고 활성 파라미터가 37B라면 Router가 전체 Expert 중 일부만 선택해 토큰당 약 37B 규모를 계산한다는 뜻입니다. 이는 모델의 전체 용량이나 저장 메모리와는 다른 지표입니다.

언급된 도구

ChatGPT중립

모델 용어에 관한 질문과 답변을 바탕으로 글을 작성하는 데 사용되었습니다.

Hugging Face중립

LLM 파일과 모델 설명을 찾아보는 배포·탐색 플랫폼으로 활용됩니다.

llama.cpp중립

GGUF 형식 모델을 활용하는 로컬 추론 소프트웨어 기반으로 언급됩니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 13.수집 2026. 08. 13.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.