관련 기사 바로가기
M3 Pro에서 27B Q4 모델을 18 tok/s로 구동8GB Jetson에서 Ling-3.0-tiny 128K 실행DFlash2로 Qwen3.8-27B 코드 생성 가속Bonsai와 Ternary 모델 생태계Strix Halo에서 DeepSeek-V4-Flash speculative decoding 측정RTX 3060 네 장으로 144GiB DeepSeek 실행Qwen3.8 NVFP4와 Q6_K 성능 비교OpenCode의 로컬 추론 예산 설정privibe, 로컬 llama.cpp 코딩 에이전트Qwen3.8-27B Uncensored Aggressive GGUF와 FastMTP 공개TensorSharp와 llama.cpp의 Muse Glimmer 추론 성능 비교MTP 로컬 성능 실험 보고TensorSharp의 MoE CPU 오프로드와 벤치마크모바일에서 대형 MoE 모델 실행 데모ARPL 공개: ARM 런타임에서 llama.cpp 최적화내 컴퓨터에서 실행 가능한 AI 모델을 미리 확인하는 방법.로컬 에이전트의 구조화된 출력 오류를 GBNF 문법으로 차단한 사례와 Eris 프로젝트 코드로컬 LLM 추론 엔진 비교: Llama.cpp vs vLLM온디바이스 bounded 툴 호출 실험과 Gemma GGUF 빌드(2.45GB)의 메모리·디코드 성능 보고albertofettucini의 Council