오픈소스 머신러닝 프레임워크인 PyTorch의 공식 블로그로, 최신 라이브러리 업데이트, 기술 튜토리얼 및 생태계 소식을 제공합니다.
PyTorch 2.13은 MPS용 FlexAttention과 CuTeDSL 백엔드, nn.LinearCrossEntropyLoss 등으로 학습과 추론 성능 및 메모리 효율을 개선했다.
PyTorch는 Monarch 런타임을 ROCm으로 포팅해 AMD Instinct GPU에서 노드 장애 시에도 중단 없이 동적으로 복구하는 탄력적 분산 학습을 실현했다.
PyTorch 주최 ExecuTorch 해커톤이 6월 27–28일 Snapdragon 기반 Galaxy S25 Ultra에서 20개 팀 이상의 온디바이스 AI 데모를 집중 개발하고 실시간·프라이버시 중심의 솔루션을 시연했다.
Miles는 SGLang, Megatron-LM, Ray, PyTorch를 결합해 MoE와 저정밀도 환경에서 대규모 LLM의 RL 포스트트레이닝을 분산 시스템 수준에서 재현 가능하고 확장성 있게 운영할 수 있게 한다.
PyTorch가 상위 PR 이벤트를 하위 저장소 CI로 자동 연계하고 결과를 HUD에 통합하는 Cross-Repository CI Relay를 도입했다.
TokenSpeed-kernel은 런타임과 하드웨어 특화 커널을 분리하는 레이어드 API·레지스트리 시스템을 제공해 다양한 GPU·벤더에서 고성능 LLM 추론을 가능하게 한다.
Linux Foundation과 PyTorch Foundation이 AI 및 머신러닝 실무자를 위한 PyTorch Certified Associate(PTCA) 자격증을 공식 출시했다.
Helion DSL을 사용하여 vLLM의 FP8 추론 커널을 최적화하고, H100 및 B200 GPU에서 처리량 향상을 달성한 사례를 소개합니다.
DeepSpeed가 Muon Optimizer를 지원하여 2D 가중치 직교화를 통한 메모리 절감 및 학습 효율 개선을 실현했다.
LinkedIn이 기존 CPU 기반의 선형 계획법 솔버 DuaLip을 PyTorch 기반 GPU 가속 시스템으로 재설계하여 최적화 성능을 75배 개선했다.
PyTorch Docathon 2026을 통해 260명 이상의 참가자가 150개 이상의 문서 개선 PR을 병합하며 커뮤니티 기여를 완료했다.
Apple Silicon GPU를 활용해 PyTorch 모델의 추론 성능을 기존 대비 3~6배 향상시키는 ExecuTorch MLX Delegate가 공개됐다.
ExecuTorch를 통해 PyTorch 모델을 Arm CPU 및 NPU 기반 엣지 디바이스에 최적화하여 배포하는 방법과 성능 이점을 설명한다.
Python의 GIL 병목을 해결하기 위해 토큰화, 도구 오케스트레이션 등 모든 CPU 부하를 Rust 기반 gRPC 레이어로 분리하여 GPU 효율을 극대화한 오픈소스 게이트웨이입니다.
AutoSP는 표준 트랜스포머 학습 코드를 다중 GPU 환경의 시퀀스 병렬화 코드로 자동 변환하여 100k 이상의 롱 컨텍스트 학습을 지원하는 컴파일러 솔루션입니다.
IBM Research가 vLLM과 Red Hat OpenShift AI를 활용해 1,300명 이상의 사용자와 100개 이상의 모델을 지원하는 중앙 집중형 추론 플랫폼 RITS를 구축했다.