본문으로 건너뛰기

LFM2.5 Q4_0 양자화 손실을 줄인 QAD GGUF

Liquid AI가 Q4_0 속도와 메모리를 유지하면서 BF16 성능의 최대 97.4%를 회복한 LFM2.5 QAD GGUF를 공개했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Liquid AI가 LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct, LFM2.5-2.6B용 QAD Q4_0 GGUF 체크포인트를 공개했습니다. QAD는 고정밀도 teacher model의 지식을 양자화된 student model에 증류해 native Q4_0의 메모리 사용량과 처리 속도를 유지하면서 양자화 손실을 줄이는 방식입니다. 네 모델은 BF16 기준 성능의 96.5~97.4%를 유지했고, 230M·350M은 Q5_K_M과 유사한 품질에서 4~33%, 1.2B·2.6B는 Q4_K_M 수준에서 3~14% 높은 decode throughput을 기록했습니다. 체크포인트는 llama.cpp 등 GGUF Q4_0 지원 런타임에서 MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra, Raspberry Pi 5 같은 장치에 배포할 수 있습니다.

섹션별 상세

01
Liquid AI가 LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct, LFM2.5-2.6B용 QAD Q4_0 GGUF 체크포인트를 공개했습니다. 기존 Q4_0은 메모리와 속도 측면에서 유리하지만 양자화 과정에서 품질이 떨어지는 문제가 있었고, QAD는 고정밀도 teacher model의 지식을 양자화된 student model에 증류하는 방식으로 이 손실을 줄입니다. 공개된 체크포인트는 native Q4_0 수준의 메모리·속도를 유지하면서 양자화로 손실된 BF16 평균 정확도의 97%를 회복하는 것을 목표로 합니다.
근거
  • QAD 체크포인트는 양자화로 손실된 BF16 평균 정확도의 97%를 회복합니다. 본문의 공개 체크포인트 특징 설명에 있는 Recovery 항목
02
네 가지 모델의 QAD Q4_0 성능은 reasoning, instruction-following, tool use, agentic capability를 포함한 벤치마크에서 post-training quantization으로 생성한 GGUF와 비교됐습니다. GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF, BFCLv4를 사용하고 모델 규모에 맞춰 230M·350M에는 GSM8K, 1.2B·2.6B에는 AIME25를 추가했으며, 각 결과는 5회 반복 평균입니다. QAD 체크포인트는 BF16 기준 성능의 97.1%, 96.5%, 97.4%, 96.6%를 각각 유지해 일반 Q4_0 체크포인트보다 일관되게 높은 품질을 기록했습니다.
LFM2.5 네 가지 모델에서 QAD Q4_0, native GGUF, F16·BF16의 평균 평가 점수를 비교한 2×2 막대그래프입니다.
Chart230M에서는 QAD Q4_0이 33.6, 350M에서는 36.1, 1.2B에서는 42.7, 2.6B에서는 64.1로 표시됩니다. 각 패널에서 QAD Q4_0은 일반 Q4_0보다 높고, 일부 모델에서는 F16·BF16 기준에 근접해 QAD가 양자화 품질 손실을 줄인다는 본문 수치를 뒷받침합니다.
근거
  • 네 모델의 QAD 체크포인트는 BF16 기준 성능의 97.1%, 96.5%, 97.4%, 96.6%를 각각 유지합니다. Benchmark results 단락의 네 모델별 BF16 baseline performance 수치
03
실제 edge hardware 측정에서는 네 모델을 MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra, Raspberry Pi 5에서 실행했습니다. MacBook Pro와 NucBox EVO-X2는 GPU inference를 사용했고 Samsung Galaxy S26 Ultra와 Raspberry Pi 5는 Arm CPU inference를 사용했으며, BF16과 F16은 가능한 경우 full-precision reference로 함께 측정했습니다. 230M과 350M QAD Q4_0은 평가 변동 범위에서 Q5_K_M과 같은 품질을 유지하면서 decode throughput이 4~33% 높았고, 1.2B와 2.6B는 Q4_K_M 수준의 품질에서 3~14% 높은 처리량을 기록했습니다.
LFM2.5-230M을 네 가지 edge hardware에서 실행했을 때 양자화 형식별 decode throughput과 평균 벤치마크 점수를 비교한 그래프입니다.
ChartMacBook M5 Max, NucBox EVO-X2, Samsung Galaxy S26 Ultra, Raspberry Pi 5에서 native GGUF 형식은 낮은 비트 양자화로 갈수록 속도가 높아지고 품질 점수가 낮아지는 경향을 보입니다. QAD Q4_0은 각 장치에서 QAD 표시점으로 제시되며, native Q4_0보다 높은 품질 위치를 유지하면서 Q5_K_M과 유사한 품질대에 놓입니다.
LFM2.5-350M의 네 가지 하드웨어별 decode throughput과 벤치마크 점수를 나타낸 그래프입니다.
ChartMacBook M5 Max에서는 QAD Q4_0이 약 810 tokens/s와 36.1점 부근에 위치하고, NucBox EVO-X2·Galaxy S26 Ultra·Raspberry Pi 5에서도 QAD가 native Q4_0보다 높은 점수를 유지합니다. 그래프의 회색 선은 BF16, F16, Q8_0, Q6_K, Q5_K_M, Q4_K_M, Q4_0 사이의 속도·품질 절충을 나타냅니다.
LFM2.5-1.2B의 MacBook M5 Max, NucBox EVO-X2, Samsung Galaxy S26 Ultra, Raspberry Pi 5 성능을 비교한 그래프입니다.
ChartQAD Q4_0은 MacBook M5 Max에서 약 475 tokens/s와 42.7점, NucBox EVO-X2에서 약 250 tokens/s와 42.7점으로 표시됩니다. 모바일·소형 Arm CPU 장치에서도 QAD 점수는 native Q4_0보다 높고 Q4_K_M과 가까운 품질을 유지해 본문의 3~14% throughput 이점을 읽을 수 있게 합니다.
LFM2.5-2.6B를 MacBook M5 Max, NucBox EVO-X2, Samsung Galaxy S26 Ultra에서 실행한 decode throughput 비교 그래프입니다.
Chart세 장치 모두 QAD Q4_0이 native Q4_0보다 높은 평균 벤치마크 점수를 기록하며, MacBook M5 Max에서는 약 240 tokens/s와 64.1점 부근에 위치합니다. 모델 규모가 커져도 QAD 방식이 Q4_0의 높은 처리량과 Q4_K_M에 가까운 품질을 함께 추구하는 구조가 유지됩니다.
근거
  • 230M과 350M QAD Q4_0은 Q5_K_M 품질에서 4~33% 높은 decode throughput을 기록합니다. Speed and size on real edge hardware 단락의 230M·350M 비교 문장
  • 1.2B와 2.6B QAD Q4_0은 Q4_K_M 품질에서 3~14% 높은 throughput을 기록합니다. Speed and size on real edge hardware 단락의 1.2B·2.6B 비교 문장
  • 측정 대상은 MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra, Raspberry Pi 5입니다. Speed and size on real edge hardware 단락의 네 하드웨어 목록과 GPU·Arm CPU 추론 구분
04
QAD Q4_0 GGUF는 llama.cpp 또는 GGUF Q4_0 artifact를 지원하는 다른 런타임에서 사용할 수 있습니다. 예시 명령은 LiquidAI/LFM2.5-350M 저장소에서 LFM2.5-350M-QAD-Q4_0.gguf 파일을 지정하고 질문을 전달하는 방식이며, 별도의 변환 단계 없이 체크포인트를 불러옵니다. 네 가지 모델 파일이 Hugging Face에서 제공되므로 메모리가 제한된 로컬 장치와 edge 환경에서 LFM2.5 모델을 배포할 때 품질·속도 균형을 선택할 수 있습니다.
bash
llama-cli -hf LiquidAI/LFM2.5-350M \
 --hf-file LFM2.5-350M-QAD-Q4_0.gguf \
 -p "What is C. elegans?"

llama-cli에서 Hugging Face의 LFM2.5-350M QAD Q4_0 GGUF 파일을 받아 질문을 생성하는 실행 예시입니다.

근거
  • QAD GGUF는 llama.cpp 또는 GGUF Q4_0 artifact를 지원하는 런타임에서 사용할 수 있습니다. How to use QAD GGUFs 단락과 llama-cli 실행 예시

용어 해설

양자화 인지 증류(Quantization-Aware Distillation)
고정밀도 teacher model의 지식을 양자화된 student model에 학습시키는 방법입니다. 먼저 양자화로 줄어든 가중치 표현을 적용한 뒤 teacher의 출력과 성능을 기준으로 student를 최적화해, Q4_0의 메모리·속도 특성을 유지하면서 양자화 손실을 줄이는 데 목적이 있습니다.
Q4_0 양자화(Q4_0)
GGUF 모델의 가중치를 4비트 수준으로 저장하는 양자화 형식입니다. BF16 같은 고정밀도 형식보다 메모리 사용량을 줄이고 추론 처리량을 높이지만, 일반적인 post-training quantization에서는 정확도 하락이 발생할 수 있어 이 글에서는 QAD 학습으로 손실을 보완합니다.
사후 학습 양자화(Post-Training Quantization)
이미 학습을 마친 모델의 가중치를 낮은 비트 수로 변환하는 방식입니다. 별도의 재학습 없이 모델 크기와 메모리 요구량을 줄일 수 있지만, 원래 BF16 성능과 비교해 정확도가 떨어질 수 있으며 글에서는 이를 QAD Q4_0과 비교 기준으로 사용합니다.
GGUF 모델 형식(GGUF)
LLM 가중치와 메타데이터를 함께 저장해 llama.cpp 같은 로컬 추론 런타임에서 사용할 수 있는 파일 형식입니다. 이 글의 QAD Q4_0 체크포인트는 GGUF 파일로 배포되며, 지원 런타임에서 낮은 메모리 사용량과 높은 decode throughput을 활용할 수 있습니다.
Decode Throughput
모델이 생성 단계에서 초당 처리하는 토큰 수를 나타내는 지표입니다. 글에서는 MacBook Pro와 NucBox EVO-X2의 GPU 추론, Samsung Galaxy S26 Ultra와 Raspberry Pi 5의 Arm CPU 추론에서 QAD Q4_0과 다른 양자화 형식의 속도를 비교합니다.

기술

  • QAD
  • GGUF
  • llama.cpp
  • Q4_0
  • Q5_K_M
  • Q4_K_M
  • BF16
  • F16
  • GPQA Diamond
  • MMLU-Pro
  • IFEval
  • IFBench
  • Multi-IF
  • BFCLv4
  • GSM8K
  • AIME25

활용 사례

  • MacBook Pro에서 LFM2.5 로컬 추론
  • NucBox EVO-X2의 GPU 기반 edge inference
  • Samsung Galaxy S26 Ultra의 Arm CPU 기반 모바일 추론
  • Raspberry Pi 5의 Arm CPU 기반 소형 장치 추론
  • 메모리 제약 환경의 LFM2.5 GGUF 배포

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 19.수집 2026. 08. 19.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.