TL;DR
Liquid AI가 LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct, LFM2.5-2.6B용 QAD Q4_0 GGUF 체크포인트를 공개했습니다. QAD는 고정밀도 teacher model의 지식을 양자화된 student model에 증류해 native Q4_0의 메모리 사용량과 처리 속도를 유지하면서 양자화 손실을 줄이는 방식입니다. 네 모델은 BF16 기준 성능의 96.5~97.4%를 유지했고, 230M·350M은 Q5_K_M과 유사한 품질에서 4~33%, 1.2B·2.6B는 Q4_K_M 수준에서 3~14% 높은 decode throughput을 기록했습니다. 체크포인트는 llama.cpp 등 GGUF Q4_0 지원 런타임에서 MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra, Raspberry Pi 5 같은 장치에 배포할 수 있습니다.
섹션별 상세
- QAD 체크포인트는 양자화로 손실된 BF16 평균 정확도의 97%를 회복합니다. — 본문의 공개 체크포인트 특징 설명에 있는 Recovery 항목

- 네 모델의 QAD 체크포인트는 BF16 기준 성능의 97.1%, 96.5%, 97.4%, 96.6%를 각각 유지합니다. — Benchmark results 단락의 네 모델별 BF16 baseline performance 수치




- 230M과 350M QAD Q4_0은 Q5_K_M 품질에서 4~33% 높은 decode throughput을 기록합니다. — Speed and size on real edge hardware 단락의 230M·350M 비교 문장
- 1.2B와 2.6B QAD Q4_0은 Q4_K_M 품질에서 3~14% 높은 throughput을 기록합니다. — Speed and size on real edge hardware 단락의 1.2B·2.6B 비교 문장
- 측정 대상은 MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra, Raspberry Pi 5입니다. — Speed and size on real edge hardware 단락의 네 하드웨어 목록과 GPU·Arm CPU 추론 구분
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"llama-cli에서 Hugging Face의 LFM2.5-350M QAD Q4_0 GGUF 파일을 받아 질문을 생성하는 실행 예시입니다.
- QAD GGUF는 llama.cpp 또는 GGUF Q4_0 artifact를 지원하는 런타임에서 사용할 수 있습니다. — How to use QAD GGUFs 단락과 llama-cli 실행 예시
용어 해설
- 양자화 인지 증류(Quantization-Aware Distillation)
- — 고정밀도 teacher model의 지식을 양자화된 student model에 학습시키는 방법입니다. 먼저 양자화로 줄어든 가중치 표현을 적용한 뒤 teacher의 출력과 성능을 기준으로 student를 최적화해, Q4_0의 메모리·속도 특성을 유지하면서 양자화 손실을 줄이는 데 목적이 있습니다.
- Q4_0 양자화(Q4_0)
- — GGUF 모델의 가중치를 4비트 수준으로 저장하는 양자화 형식입니다. BF16 같은 고정밀도 형식보다 메모리 사용량을 줄이고 추론 처리량을 높이지만, 일반적인 post-training quantization에서는 정확도 하락이 발생할 수 있어 이 글에서는 QAD 학습으로 손실을 보완합니다.
- 사후 학습 양자화(Post-Training Quantization)
- — 이미 학습을 마친 모델의 가중치를 낮은 비트 수로 변환하는 방식입니다. 별도의 재학습 없이 모델 크기와 메모리 요구량을 줄일 수 있지만, 원래 BF16 성능과 비교해 정확도가 떨어질 수 있으며 글에서는 이를 QAD Q4_0과 비교 기준으로 사용합니다.
- GGUF 모델 형식(GGUF)
- — LLM 가중치와 메타데이터를 함께 저장해 llama.cpp 같은 로컬 추론 런타임에서 사용할 수 있는 파일 형식입니다. 이 글의 QAD Q4_0 체크포인트는 GGUF 파일로 배포되며, 지원 런타임에서 낮은 메모리 사용량과 높은 decode throughput을 활용할 수 있습니다.
- Decode Throughput
- — 모델이 생성 단계에서 초당 처리하는 토큰 수를 나타내는 지표입니다. 글에서는 MacBook Pro와 NucBox EVO-X2의 GPU 추론, Samsung Galaxy S26 Ultra와 Raspberry Pi 5의 Arm CPU 추론에서 QAD Q4_0과 다른 양자화 형식의 속도를 비교합니다.
기술
- QAD
- GGUF
- llama.cpp
- Q4_0
- Q5_K_M
- Q4_K_M
- BF16
- F16
- GPQA Diamond
- MMLU-Pro
- IFEval
- IFBench
- Multi-IF
- BFCLv4
- GSM8K
- AIME25
활용 사례
- MacBook Pro에서 LFM2.5 로컬 추론
- NucBox EVO-X2의 GPU 기반 edge inference
- Samsung Galaxy S26 Ultra의 Arm CPU 기반 모바일 추론
- Raspberry Pi 5의 Arm CPU 기반 소형 장치 추론
- 메모리 제약 환경의 LFM2.5 GGUF 배포
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.