관련 기사 바로가기
A100 한 장에 128K 사용자 9명Qwen3.8 NVFP4와 Q6_K 성능 비교Windows에서 RX 6750 XT용 native vLLM·ROCm 런타임 구축NullOrigin AI 워터마크 무력화 프록시Qwen3.8 자체 호스팅에 필요한 GPU 구성HyperPod와 Curvine으로 확장하는 계층형 KV 캐시로컬 코딩 에이전트의 KV 캐시·양자화 한계 측정로컬 AI와 에이전트를 위한 두 대의 머신·컨테이너 스택 설계 경험 공유로컬 LLM 추론 엔진 비교: Llama.cpp vs vLLMalbertofettucini의 CouncilLLM 추론을 위한 API 게이트웨이와 워커 아키텍처 설계. 인메모리 큐와 동적 배처로 GPU 활용을 최적화한다. 토큰 스트리밍으로 Time-To-First-Token을 줄이는 방식을 제시한다.ModelExpress: 모델 가중치와 커널 아티팩트를 GPU 메모리로 초고속 배포하기PyTorch Foundation의 프로젝트 업데이트Open-Reasoner-Zero: 베이스 모델에서 추론 지향 강화학습 확장을 위한 오픈소스 접근KV Cache와 GPU 메모리 병목, PagedAttention이 해결한 방식Amazon SageMaker HyperPod에서 분리된 Prefill-Decode 추론 구현Amazon SageMaker HyperPod의 추론 데이터 캡처와 배포·운영 개선을 위한 기능 정리A100‑80GB 한 대로 128K 컨텍스트 동시 처리 실험과 KV 캐시 압축 성능실제 테스트 스위트로 파인튜닝 효과를 검증하는 도구 공개 및 사전등록 실험 결과 공유ELDR: PD 분리형 MoE 서비스에서 전문가-지역성 인식 디코드 라우팅