본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
Champoleello의 agentpause가 무료 API 요금 한도 전에 LLM 에이전트를 안전하게 중단하고 작업 손실 없이 재개함
BigMoeOnEdge 플래시 스트리밍으로 모바일에서 MoE 실행
cpubrrr: 바닥부터 구현한 CPU·GPU 추론 엔진과 Apple M4 Max
Qwen3.6-35B에 대한 사후적 Adaptive MoE 게이팅 실험과 실증적 벤치마크
로컬 파일 검색 및 LLM 질의를 위한 초고속 CLI 도구 qi 공개
Claude Code와 Elixir를 활용한 실시간 AI 음성 비서 업그레이드 사례
PDF를 로컬 팟캐스트 대화로 변환하는 도구 공개
swellweb/reame: llama.cpp 기반 CPU 우선 LLM 추론 서버와 모델별 SEO 감사 비교
RX 6650 XT 환경에서 speculative decoding의 에너지 측정 결과 공유
TensorSharp에서 GGML 기반 Vulkan 백엔드 초기 버전 공개와 llama.cpp 대비 벤치마크 결과가 공유되었다. 이 공개는 TensorSharp가 GGUF 모델 지원과 여러 GPU 백엔드(CUDA, Metal, Vulkan)를 목표로 한다는 점을 명확히 드러냈다. 작성자는 Nvidia와 Intel GPU에서의 동작과 성능표를 제공하며 AMD 테스트 참여를 요청했다.
Qwythos-9B의 Q4_K_M과 Q8_0 양자화 비교와 벤치마크 호환성 보고서이다.
mnn·llama.CPP·gguf 통합 모바일 AI 앱 공개와 성능 보고
TensorSharp: GGUF 모델용 네이티브 .NET LLM 추론 엔진과 llama.cpp 직접 벤치마크
장기 LLM 메모리와 컨텍스트 관리를 위한 ContextForge 논문 및 구현 공개
로컬 LLM 실행을 위한 고성능 래퍼, LlamaStash 소개
Qwen3.5 소개: 개요, vLLM 및 llama.cpp 활용 가이드
로컬 LLM 에이전트를 위한 지속성 메모리 및 자기 성찰 프레임워크 CogniCore 공개
분산 llama.cpp RPC 풀을 활용한 추측성 디코딩 구현
GPU 없이 Intel NUC에서 도메인 특화 Gemma 모델 구축 및 배포 성공 사례
CLIO: 터미널 네이티브 자율 AI 코딩 에이전트
← 피드로 돌아가기
llama.cpp
Inference Engines (추론 엔진)
약 169개 아티클
관련 태그:
Qwen3.5
GGUF
Qwen
Ollama
Claude Code
Hugging Face
ROCm
GGML
vLLM
Quantization