본문으로 건너뛰기

AINews: vLLM 0.20 출시 및 DeepSeek V4 최적화 경쟁

vLLM 0.20 출시와 함께 DeepSeek V4를 위한 하드웨어 최적화 경쟁 및 Poolside, NVIDIA의 신규 모델 릴리스 소식을 다룹니다.

섹션별 상세

vLLM v0.20.0은 TurboQuant 2비트 KV 캐시를 도입하여 KV 용량을 4배 확장하고 추론 효율을 극대화했습니다. FA4를 재활성화하여 SM90+ 하드웨어에서 MLA 프리필 성능을 개선했으며, 새로운 vLLM IR 파운데이션과 fused RMSNorm을 통해 엔드투엔드 지연시간을 2.1% 줄였습니다. DeepSeek V4 MegaMoE 지원을 포함해 Blackwell, Jetson Thor, ROCm 등 광범위한 하드웨어 생태계로 지원 범위를 넓혔습니다.
근거
  • vLLM v0.20.0은 TurboQuant 2-bit KV 캐시를 통해 KV 용량을 4배로 늘렸다. Inference Systems, vLLM 0.20 섹션
  • fused RMSNorm 적용으로 엔드투엔드 지연시간이 2.1% 개선되었다. vLLM v0.20.0 릴리스 노트 요약 부분
DeepSeek V4 서빙을 둘러싼 하드웨어 및 커널 최적화 경쟁이 심화되고 있습니다. SemiAnalysis에 따르면 B300 가속기는 특정 워크로드에서 H200보다 최대 8배 빠른 성능을 보이며, DeepGEMM MegaMoE 커널은 디스패치와 GEMM을 단일 커널로 융합하여 효율을 높입니다. 또한 DeepSeek이 TileKernels를 통해 CUDA 종속성에서 벗어나 이기종 가속기 환경으로 이동하려는 구조적 변화가 관찰됩니다.
Poolside와 NVIDIA가 실무 중심의 오픈 모델을 각각 출시했습니다. Poolside의 Laguna XS.2는 33B(활성 3B) MoE 코딩 모델로 단일 GPU에서 실행 가능하며 Apache 2.0 라이선스로 공개됐습니다. NVIDIA의 Nemotron 3 Nano Omni는 30B 규모의 멀티모달 MoE 모델로 256K 컨텍스트를 지원하며, 음성 이해를 위한 Parakeet 인코더를 탑재해 기존 오픈 모델 대비 약 9배의 처리량을 제공합니다.
근거
  • NVIDIA Nemotron 3 Nano Omni는 유사한 오픈 옴니 모델 대비 약 9배의 처리량을 보여준다. Open Model Releases 섹션의 Nemotron 3 Nano Omni 설명
에이전트 기술이 단순 데모를 넘어 프로덕션 운영 단계로 진화하고 있습니다. Mistral은 워크플로 오케스트레이션 레이어인 Workflows를 공개하여 에이전트 프로세스의 관측 가능성과 내결함성을 확보했습니다. 동시에 Teknium과 Hugging Face 등은 로컬 환경에서 완전히 오프라인으로 작동하는 에이전트 구현 가능성을 증명하며 개인화된 AI 워크플로의 확산을 예고했습니다.

기술

  • vLLM
  • DeepSeek V4
  • NVIDIA Nemotron
  • Poolside Laguna
  • Mistral Workflows
  • Blackwell
  • ROCm

활용 사례

  • 대규모 MoE 모델의 고효율 서빙
  • 로컬 환경에서의 프라이빗 코딩 에이전트
  • 기업용 복합 워크플로 자동화

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 29.수집 2026. 04. 29.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.