본문으로 건너뛰기

관련 기사 바로가기

Jacobian 기반 Noise Injection으로 LLM 양자화 견고성 강화추론 비용 최적화더 작고 느리고 부정확: 공격적 양자화가 온디바이스 추론에 미치는 비용OmniStack-RS: 추천 시스템을 위한 KV 캐시 압축 및 개인화 추론 실험QPrompt: 시각 언어 모델의 효율적 일반화를 위한 양자화된 프롬프트llama.cpp에서 SWA 모델의 VRAM 사용량을 3배 줄이는 최적화 방법ByteShape Qwen 3.5 9B: 하드웨어에 맞는 최적의 양자화 모델 선택 가이드액션 양자화를 이용한 행동 모방 학습의 이해AMD 미니 PC에서 LLM 성능 최적화를 위한 GPU 메모리 할당 가이드TorchAO: Unsloth 및 Axolotl 통합과 PARQ를 통한 양자화 인식 학습(QAT) 가속화컴퓨터 비전 모델의 추론 속도를 높이는 방법양자화(Quantization)란 무엇인가?DeepSeek-R1-Distill-1.5B 모델의 KV 캐시 중복성 측정 결과 공유SALOMI: 초저비트 트랜스포머 양자화 및 추론 연구 저장소 공개소비자용 하드웨어 구동을 위한 9B Qwen 구조화 데이터 추출 모델 양자화 벤치마크GB10 기반 KV 캐시 양자화 벤치마크: q4_0의 성능 폭락 및 메모리 역설 확인양자화 모델의 성능과 효율성 이해하기LLM 용어 가이드: 가중치, 추론, 유효 시퀀스 길이 및 셀프 호스팅 해설Taalas, Llama 3.1 8B 모델을 초당 17,000 토큰으로 구동하는 전용 하드웨어 발표Databricks Model Serving: 30만 QPS 이상의 확장성 지원 및 고성능 서빙 모범 사례
← 피드로 돌아가기

Quantization

Optimization (최적화 기법)

60개 아티클

관심 태그 추가
TIMEHEADLINE