VRAM은 남는데 RAM이 부족해서 꺼진다고? llama.cpp 100k 컨텍스트의 함정
llama.cpp로 100k 컨텍스트 추론 시 VRAM 여유와 상관없이 시스템 RAM 사용량이 급증하여 프로세스가 강제 종료되는 현상이 보고됐다.
로컬 LLM 실행, 파인튜닝, 최적화 기술 논의 (30만+ 구독자)
llama.cpp로 100k 컨텍스트 추론 시 VRAM 여유와 상관없이 시스템 RAM 사용량이 급증하여 프로세스가 강제 종료되는 현상이 보고됐다.
RTX 4060/3050 조합의 16GB VRAM 환경에서 Gemma 4 31B 모델을 Claude Code CLI와 연동하여 로컬 자율 코딩 에이전트를 구현한 실험기이다.
Tencent의 HunyuanOCR 1B 모델이 GGUF 포맷을 통해 GTX 1060에서도 90 t/s의 속도와 높은 정확도를 기록하며 로컬 OCR의 새로운 표준이 됐다.
Intel 258V iGPU 환경에서 다양한 GGUF 양자화 형식의 추론 속도와 품질 손실(KLD)을 비교하여 최적의 성능 균형점을 도출했다.
Phi-4-mini 모델에서 LayerNorm 감마 파라미터만 학습시키는 BALLAST 기법을 실험했으나, 모든 벤치마크에서 성능이 하락하며 LoRA 대비 실효성이 없음을 확인했다.
HTML을 DOM 정보가 포함된 Markdown으로 변환하여 LLM이 재사용 가능한 스크레이핑 코드를 생성하도록 돕는 도구이다.
한 변호사가 10대의 Tesla V100 GPU를 NVLink로 연결하여 320GB VRAM 서버를 구축하고, vLLM을 활용한 최적화 설정 및 벤치마크 결과를 공유했다.
1998년형 iMac G3 하드웨어 제약을 극복하고 260K 파라미터의 Llama 2 모델 추론을 구현한 프로젝트이다.
로컬 LLM의 확산을 위해서는 단순한 모델 성능 향상보다 예측 가능한 인프라와 안정적인 워크플로우 구축이 더 중요하다는 논의이다.
구독형 음성 인식 서비스 대신 로컬 모델과 사용자 API 키 연동을 지원하여 비용 부담을 없앤 윈도우용 오픈소스 앱 Dictate가 공개됐다.
로컬 LLM의 물리적 상식과 논리적 우선순위를 테스트하기 위한 고유 프롬프트 세트와 Gemma 및 MoE 모델의 테스트 결과를 분석했다.
vLLM 포크를 사용하여 AMD 하드웨어에서 Qwen 3.5 27B와 Gemma 4 31B의 추론 처리량 및 지연 시간을 비교 분석한 벤치마크 결과이다.
MoE 모델의 거부 메커니즘이 정치적 검열과 안전 가드레일로 분리되어 있음을 밝히고, 추론 시점의 훅을 통해 이를 선택적으로 제거하는 기법을 제시했다.
ZAYA OS는 Flux1, CogVideoX, Qwen3 등 다양한 로컬 모델을 통합하여 하드웨어 리소스만으로 고품질 이미지, 비디오, 음성을 생성하는 오픈소스 자율 콘텐츠 제작 시스템이다.
TensorRT 에이전트로 난독화된 모델의 가중치를 역공학하여 추출할 수 있는 도구가 GitHub에 공개되어 보안 주의가 요구된다.
M4 Mac 환경에서 SmolLM2-360M 모델에 GRPO 강화학습을 적용하며 겪은 메모리 파편화, 데이터 타입 선택, 보상 설계 문제를 공유한다.
이탈리아어 처리에 최적화된 커스텀 토크나이저와 GQA 아키텍처를 갖춘 2.1B 오픈소스 모델 Dante-2B의 개발 및 학습 과정 공유.
AMD RX 7900 XT 환경에서 ACE-Step 1.5의 추론 및 LoRA 학습 파이프라인을 구축하고 주요 라이브러리 버그를 해결한 사례이다.
Qwen 3.5 모델의 로컬 추론 시 발생하는 XML 파싱 오류, 생각(Thinking) 태그 누출 등 4대 버그를 분석하고 서버별 대응 현황과 클라이언트 측 해결 코드를 제시한다.
텐센트가 10억 파라미터 규모의 경량화된 엔드투엔드 OCR 전용 시각 언어 모델(VLM)인 HunyuanOCR을 공개했다.
로컬 GGUF 모델의 함수 호출 시 파일 시스템과 쉘 접근을 제한하여 보안을 강화하는 OpenAI 호환 추론 커널이다.
독일의 비영리 단체가 Qwen3 30B와 Ollama를 활용해 구축한 프라이버시 중심의 무료 웹 검색 AI 어시스턴트 'bairat' 프로젝트를 공유했다.
Kokoro TTS의 커스텀 목소리 학습 도구인 KVoiceWalk에 GPU/CUDA 지원과 GUI 큐 시스템을 추가하여 학습 속도를 6.5배 향상시킨 프로젝트가 공개됐다.
뉴로모픽 하드웨어와 SNN 변환 기술을 통해 LLM 추론의 에너지 효율을 극대화하고 폰 노이만 병목을 해결하려는 최신 연구 동향 요약.