본문으로 건너뛰기

PyTorch Foundation의 프로젝트 업데이트

PyTorch Foundation이 PyTorch, vLLM, DeepSpeed 등을 포함한 6개 프로젝트의 분기별 기술 성과와 로드맵을 공개했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

PyTorch Foundation은 다중 프로젝트 재단으로 확장되어 PyTorch, vLLM, DeepSpeed 등 여섯 개 프로젝트의 분기별 성과와 로드맵을 공개했고, 각 프로젝트는 성능 최적화와 플랫폼 확장, 생태계 연계를 통해 개발 모멘텀을 강화하고 있다. PyTorch는 Q2에 4,415개의 커밋을 기록하며 2.13 릴리스를 통해 Apple Silicon용 FlexAttention(약 12배 성능 향상), CuTeDSL Inductor 백엔드, nn.LinearCrossEntropyLoss(피크 메모리 최대 4배 절감) 등 하드웨어·메모리 최적화를 도입했고 분산 학습을 위해 torchcomms와 FSDP2 통신 오버랩을 추가했다. vLLM은 Model Runner V2 재설계로 GPTQ 워크로드 성능을 개선하고 격주 릴리스 주기를 확립했으며 Q3 2026 로드맵에서 KV cache 재설계, 스케줄러 개선, AgentX 성능 목표 등 대형 서빙과 에이전트 운영을 위한 기술 과제를 우선순위로 설정했다. 이러한 업데이트는 기저 인프라와 실행 엔진 측면에서 성능·메모리·플랫폼 도달성을 동시에 높여 대형 모델 서빙과 엣지 실행의 실무적 적용성을 강화하는 방향으로 전개되었다.

섹션별 상세

01
PyTorch Foundation은 2025년 4월에 다중 프로젝트 재단으로 확장되어 여러 도메인 간 협업을 촉진하고 AI 전체 생애주기에서 혁신 확산을 지원하는 체계를 갖추었다. 재단은 현재 PyTorch, vLLM, DeepSpeed, Ray, Helion, Safetensors 등 여섯 개 프로젝트를 호스팅하며 각 프로젝트는 분기별 성과와 개발 로드맵을 공개하는 블로그 시리즈로 업데이트를 공유하고 있다. 이러한 구조는 프로젝트별 기술 축적을 공동 인프라와 연계해 재활용하고 상호 보완적 개발을 촉진하는 기제로 작동하므로 도구·엔진·모듈 간 통합과 규모 확장이 수월해졌다.
02
핵심 PyTorch 프로젝트는 코드 기여와 이슈 관리 측면에서 활발한 개발 모멘텀을 유지하고 있으며, 분기 내 커밋 4,415건을 기록하고 열린 이슈 수가 점진적으로 감소하는 추세를 보였다. PyTorch 2.13은 Apple Silicon에서 FlexAttention을 지원해 SDPA 대비 최대 약 12배 빠른 성능을 제공하고 CuTeDSL Inductor 백엔드를 추가해 하드웨어별 코드 생성 경로를 확장했으며, nn.LinearCrossEntropyLoss는 피크 GPU 메모리를 최대 4배까지 절감하는 메모리 최적화를 도입했다. 배포 측면에서는 Python 3.15 wheel과 free-threaded 빌드를 지원하고 torchcomms 백엔드와 FSDP2 통신 오버랩을 넣어 대규모 클러스터 학습과 ROCm/Arm/Intel XPU 플랫폼 지원을 넓혀 플랫폼 도달성과 분산 학습 효율을 동시에 향상시켰다.
03
vLLM 프로젝트는 안정적인 격주 릴리스 주기를 확립했고, Model Runner V2의 설계 재구성으로 GPTQ 기반 워크로드에서 의미 있는 성능 개선을 달성했다. 프로젝트는 Kimi K3, Minimax M3, Qwen 3.8 같은 대형 모델에 대한 day-zero 지원을 제공하고 있으며, Q3 2026 로드맵을 SIG(특별 관심 그룹) 중심으로 조직해 production agentic 워크로드, 고상호작용 프리미엄 토큰 처리, Flat Model·Model Runner V2 마이그레이션, 스케줄러와 KV cache 재설계를 핵심 과제로 삼고 있다. 또한 AgentX 상에서의 최고 성능 목표와 KV cache 오프로드·프리픽스 캐싱 개선, 빠른 speculative decoding 및 CI 고속화 같은 대형 서빙·에이전트 운영 관련 기술 궤도를 구체화하면서 Ray Summit의 vLLM 컨퍼런스 개최로 커뮤니티·생태계 확장을 병행하고 있다.

용어 해설

FlexAttention
FlexAttention은 표준 SDPA(Self-Attention with Dot-Product Attention) 대신 더 적은 연산과 메모리로 attention을 계산하도록 설계된 기법으로, Apple Silicon과 같은 특정 하드웨어에서 레이턴시와 처리량을 개선하기 위해 연산 패턴을 변경하여 최대 성능 이점을 확보한다. 본문에서는 Apple Silicon에서 SDPA 대비 약 12배 빠른 성능 개선 사례와 함께 등장하여 플랫폼 특화 최적화의 예로 활용되었다.
CuTeDSL Inductor
CuTeDSL Inductor는 PyTorch 인더터(Inductor) 백엔드 중 하나로 커널 생성과 최적화를 위해 DSL 기반 접근법을 사용하여 GPU 코드 생성 경로를 개선하는 컴파일러 구성요소이다. 본문에서는 PyTorch 2.13에 포함된 새로운 Inductor 백엔드로 언급되어 플랫폼별 성능 최적화와 연계되어 있다.
FSDP2
FSDP2는 대규모 분산 학습에서 메모리 오버헤드를 줄이고 통신과 계산을 겹치게 처리하는 Full Sharded Data Parallel의 확장으로, 통신 오버랩 기능을 통해 대형 클러스터 학습의 처리 효율을 높이는 구조적 개선을 포함한다. 글에서는 대규모 클러스터 훈련을 위한 통신 오버랩 기능 추가로 소개되었다.
ExecuTorch
ExecuTorch는 on-device LLM 실행과 최적화를 목표로 하는 프로젝트 또는 프레임워크로, 경량화된 실행 경로와 예제 중심 배포를 통해 모바일·엣지 환경에서 모델을 구동하도록 개발자가 접근하기 쉽게 만든 구성 요소이다. 본문에서는 주간 예제 공개와 Hugging Face와의 협력으로 on-device 모델 도입을 확대하는 활동이 언급되었다.
KV 캐시(KV cache)
KV cache는 Transformer 계열 모델의 디코딩 과정에서 이전 토큰의 키와 값 쌍을 저장해 반복 계산을 줄이는 구조로, 대화형·멀티턴 환경에서 응답 속도와 비용 효율을 높이기 위해 오프로드·압축·스케줄링 기법이 적용된다. 본문에서는 vLLM의 로드맵에서 KV cache 오프로드 개선과 압축 기능이 핵심 목표로 설정되었다.

기술

  • PyTorch
  • ExecuTorch
  • FlexAttention
  • CuTeDSL Inductor
  • nn.LinearCrossEntropyLoss
  • torchcomms
  • FSDP2
  • vLLM
  • Model Runner V2
  • KV cache

활용 사례

  • on-device LLM 실행 및 최적화
  • 대규모 클러스터 분산 학습
  • 에이전트형 고상호작용 대화형 서빙
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 22.수집 2026. 07. 23.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.