본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
추론 비용 최적화
더 작고 느리고 부정확: 공격적 양자화가 온디바이스 추론에 미치는 비용
양자화(Quantization)란 무엇인가?
OmniStack-RS: 추천 시스템을 위한 KV 캐시 압축 및 개인화 추론 실험
QPrompt: 시각 언어 모델의 효율적 일반화를 위한 양자화된 프롬프트
llama.cpp에서 SWA 모델의 VRAM 사용량을 3배 줄이는 최적화 방법
ByteShape Qwen 3.5 9B: 하드웨어에 맞는 최적의 양자화 모델 선택 가이드
액션 양자화를 이용한 행동 모방 학습의 이해
LLM 용어 가이드: 가중치, 추론, 유효 시퀀스 길이 및 셀프 호스팅 해설
AMD 미니 PC에서 LLM 성능 최적화를 위한 GPU 메모리 할당 가이드
TorchAO: Unsloth 및 Axolotl 통합과 PARQ를 통한 양자화 인식 학습(QAT) 가속화
컴퓨터 비전 모델의 추론 속도를 높이는 방법
임베딩 트레이드오프의 정량적 분석: 비용, 품질, 지연 시간의 균형 잡기
DeepSeek-R1-Distill-1.5B 모델의 KV 캐시 중복성 측정 결과 공유
SALOMI: 초저비트 트랜스포머 양자화 및 추론 연구 저장소 공개
소비자용 하드웨어 구동을 위한 9B Qwen 구조화 데이터 추출 모델 양자화 벤치마크
GB10 기반 KV 캐시 양자화 벤치마크: q4_0의 성능 폭락 및 메모리 역설 확인
양자화 모델의 성능과 효율성 이해하기
Taalas, Llama 3.1 8B 모델을 초당 17,000 토큰으로 구동하는 전용 하드웨어 발표
Databricks Model Serving: 30만 QPS 이상의 확장성 지원 및 고성능 서빙 모범 사례
← 피드로 돌아가기
Quantization
Optimization (최적화 기법)
약 67개 아티클
관련 태그:
KV-cache
llama.cpp
Qwen3.5
GGUF
MoE
Snapdragon
Transformer
ONNX
Best Practice
TurboQuant