관련 기사 바로가기
구형 GPU의 재발견: Titan X Pascal을 활용한 로컬 LLM 추론 성능 테스트OmniCoder-9B: 코딩 및 도구 호출에 최적화된 로컬 모델 추천ROCm 기반 llama.cpp 사용을 단순화하는 llama-runner 래퍼 및 채팅 템플릿 문제 공유llama.cpp의 mmap 취약점을 이용한 로컬 LLM 추론 변조 PoCQwen 3.5-35B 에이전트의 도구 호출 오류 및 성능 최적화 해결 사례llama.cpp 최신 빌드와 ROCm 백엔드를 활용한 Strix Halo 성능 향상 보고RTX 6000과 5090을 결합한 80GB VRAM 환경에서 코딩용 LLM 추천 및 llama.cpp 오류 해결 요청Arandu v0.5.82 출시 - Llama.cpp 모델 관리 및 실행 도구Qwen 3.5 CPU 추론에서 ik_llama.cpp가 mainline llama.cpp를 압도하는 성능 기록AMD Radeon Pro R9700(W9700) AI 성능 및 발열 설계 결함 실사용 후기온디바이스 LLM 전환으로 개인정보 보호 정책과 GDPR 문제 해결Llama.cpp: 자동 파서 생성기(Autoparser) 메인라인 병합 완료2x RTX 3090 기반 영구 메모리를 갖춘 로컬 디스코드 에이전트 구축기RTX 3090 Ti에서 Qwen 3.5 35B 모델의 컨텍스트가 11k로 제한되는 문제 해결 요청Qwen 27B 모델 프롬프트 처리 속도 최적화: GPU L3 캐시 기반 ubatch-size 설정법llama.cpp에서 Qwen 3.5 35B 실행 시 KV 캐시를 BF16으로 설정해야 하는 이유ZImage 텍스트 인코더 8GB에서 2.5GB로 최적화: llama.cpp와 정렬 어댑터 활용 사례llama.cpp의 비전 모델 프롬프트 캐싱과 Qwen 아키텍처의 한계로컬 멀티모달 LLM을 활용한 GUI 자동화 파이프라인 구축 및 모델 추천 문의GLM-5 모델의 추론(Reasoning) 모드가 ik_llama.cpp에서 작동하지 않는 문제