관련 기사 바로가기
B200에 맞춘 Helion Mamba-2 커널 최적화MIRA 공개: General Intuition·Kyutai·Epic Games 협업 게임 에이전트 발표SambaNova와 Nvidia B200을 결합한 차세대 하이브리드 AI 추론 데모Helion 커널을 위한 LLM 기반 자동 튜닝: 성능 최적화 시간 6.7배 단축Inference Engineering 원칙 기반의 LLM VRAM 계산기 구축기NVIDIA B200에서 MXFP8 및 NVFP4 양자화를 활용한 확산 모델 추론 가속화TorchInductor를 위한 새로운 CuteDSL 백엔드: Blackwell GPU에서 GEMM 성능 극대화SeqPU: 로컬 하드웨어를 넘어 B200 GPU로 확장하는 LLM 배포 플랫폼Google Gemma 4 공개 및 B200 기반 QLoRA 학습 과정에서의 트러블슈팅범용 내적 어텐션(GDPA): 실제 추천 시스템 학습 부하를 위한 커널 최적화P-EAGLE: vLLM에서 병렬 투기적 디코딩을 통한 LLM 추론 가속화PyTorch Helion: ML 기반 LFBO 알고리즘으로 커널 오토튜닝 속도와 성능 동시 개선Together AI, 캐시 인식 프리필-디코드 분리(CPD)로 긴 컨텍스트 추론 성능 혁신FastVideo 팀: 실시간 비디오 생성 및 라이브 프롬프트 편집 프로토타입 공개하드웨어 사양과 모델 아키텍처 기반의 LLM 클러스터 시뮬레이터 공개