본문으로 건너뛰기

관련 기사 바로가기

Qwythos-9B-Claude-Mythos-5-1M을 llama.cpp로 로컬 구동해 Pi 코딩 에이전트와 연동하고 MTP speculative decoding 및 OpenAI 호환 API로 빠른 로컬 코딩 워크플로 구성Champoleello의 agentpause가 무료 API 요금 한도 전에 LLM 에이전트를 안전하게 중단하고 작업 손실 없이 재개함BigMoeOnEdge 플래시 스트리밍으로 모바일에서 MoE 실행cpubrrr: 바닥부터 구현한 CPU·GPU 추론 엔진과 Apple M4 Maxswellweb/reame: llama.cpp 기반 CPU 우선 LLM 추론 서버와 모델별 SEO 감사 비교RX 6650 XT 환경에서 speculative decoding의 에너지 측정 결과 공유TensorSharp에서 GGML 기반 Vulkan 백엔드 초기 버전 공개와 llama.cpp 대비 벤치마크 결과가 공유되었다. 이 공개는 TensorSharp가 GGUF 모델 지원과 여러 GPU 백엔드(CUDA, Metal, Vulkan)를 목표로 한다는 점을 명확히 드러냈다. 작성자는 Nvidia와 Intel GPU에서의 동작과 성능표를 제공하며 AMD 테스트 참여를 요청했다.Qwythos-9B의 Q4_K_M과 Q8_0 양자화 비교와 벤치마크 호환성 보고서이다.mnn·llama.CPP·gguf 통합 모바일 AI 앱 공개와 성능 보고Qwen3.6-35B에 대한 사후적 Adaptive MoE 게이팅 실험과 실증적 벤치마크TensorSharp: GGUF 모델용 네이티브 .NET LLM 추론 엔진과 llama.cpp 직접 벤치마크장기 LLM 메모리와 컨텍스트 관리를 위한 ContextForge 논문 및 구현 공개로컬 LLM 실행을 위한 고성능 래퍼, LlamaStash 소개Qwen3.5 소개: 개요, vLLM 및 llama.cpp 활용 가이드로컬 파일 검색 및 LLM 질의를 위한 초고속 CLI 도구 qi 공개Claude Code와 Elixir를 활용한 실시간 AI 음성 비서 업그레이드 사례로컬 LLM 에이전트를 위한 지속성 메모리 및 자기 성찰 프레임워크 CogniCore 공개PDF를 로컬 팟캐스트 대화로 변환하는 도구 공개분산 llama.cpp RPC 풀을 활용한 추측성 디코딩 구현GPU 없이 Intel NUC에서 도메인 특화 Gemma 모델 구축 및 배포 성공 사례
← 피드로 돌아가기

llama.cpp

Inference Engines (추론 엔진)

219개 아티클

관심 태그 추가
TIMEHEADLINE