본문으로 건너뛰기

관련 기사 바로가기

100만 장의 이미지 분류 속도를 10배 향상시키는 방법: 로컬 LLM 추론 최적화 논의바이두, 4B 파라미터 엔드투엔드 문서 이해 모델 'Qianfan-OCR' 오픈소스 공개Ranvier: LLM 추론 효율을 극대화하는 콘텐츠 인식 로드 밸런서Ray Data LLM: vLLM 동기식 엔진 대비 2배 높은 처리량 구현llmtop: LLM 추론 클러스터를 위한 실시간 터미널 대시보드llamactl: llama.cpp, MLX, vLLM 모델을 위한 통합 관리 및 라우팅 도구AWS, llm-d 기반의 LLM 분산 추론(Disaggregated Inference) 기능 발표RTX 5060 Ti (Blackwell)에서 vLLM으로 AWQ 모델 실행하기: awq_marlin과 TRITON_ATTN이 핵심P-EAGLE: vLLM에서 병렬 투기적 디코딩을 통한 LLM 추론 가속화BYOL: SSH 터널링을 통해 원격 서버에서 로컬 LLM 사용하기NVIDIA Jetson과 OpenClaw를 활용한 온디바이스 오픈 모델 최적화 및 물리적 AI 시스템 구축LLM 엔지니어가 반드시 알아야 할 파이썬 라이브러리 10선AI 에이전트가 실제로 작동하는 8가지 도메인: 강화학습의 실무 적용 현황Granite 4.0 1B Speech: 엣지 엔터프라이즈를 위한 컴팩트 다국어 음성 모델Olmo Hybrid와 미래의 LLM 아키텍처: Transformer를 넘어서는 효율성Amazon SageMaker 및 Bedrock에서 vLLM을 활용한 효율적인 Multi-LoRA MoE 모델 서빙 최적화FriendliAI로 전환하고 최대 5만 달러의 추론 크레딧 혜택 받기vLLM: PagedAttention 기반의 고성능 LLM 추론 및 서빙 라이브러리llm-d FS 백엔드: vLLM을 위한 공유 스토리지 기반 KV 캐시 오프로딩PyTorch 재단, 에이전트 AI 수요 증가에 따라 신규 회원사 발표
← 피드로 돌아가기

vLLM

Inference Engines (추론 엔진)

209개 아티클

관심 태그 추가
TIMEHEADLINE