TL;DR
PyTorch 2.14는 2,995개 커밋과 487명의 기여를 바탕으로 GPU 커널 최적화, 분산 학습 복구, Apple Silicon 연산, 동적 shape 컴파일, 플랫폼 호환성을 넓힌 릴리스입니다. NVGEMM은 CuTeDSL 기반 GEMM 커널에 epilogue fusion과 저정밀 연산을 결합하고, nccl2와 c10d 재구성 인터페이스는 통신 장애가 발생한 대규모 학습 작업을 프로세스 그룹 전체 재시작 없이 복구할 수 있는 경로를 마련합니다. Apple Silicon에서는 Metal 기반 선형대수와 attention 커널이 강화됐으며, MPS의 단일 토큰 decode 경로는 bf16·fp16에서 보고된 8.5배 저하 문제를 보완하고 prefill attention은 기존 커널 대비 약 2~4배 빨라졌습니다. Python 3.15와 3.15t wheel도 추가됐지만 torch.compile은 아직 지원되지 않아 eager 실행만 가능합니다.
섹션별 상세
# CPU pip3 install torch –index-url https://download.pytorch.org/whl/cpu # CUDA (substitute the CUDA version, e.g. cu126 / cu130) pip3 install torch –index-url https://download.pytorch.org/whl/cu130 # ROCm (substitute the ROCm version) pip3 install torch –index-url https://download.pytorch.org/whl/rocm7.14 # XPU pip3 install torch –index-url https://download.pytorch.org/whl/xpuPython 3.15와 free-threaded 3.15t용 PyTorch wheel을 CPU, CUDA, ROCm, XPU별 다운로드 인덱스에서 설치하는 명령입니다.
용어 해설
- Inductor
- — PyTorch 그래프를 GPU와 CPU에서 실행할 커널 코드로 변환하는 컴파일러 백엔드입니다. 연산을 결합하고 커널 실행 순서를 조정하며 하드웨어별 구현을 선택해 모델 실행의 메모리 접근과 호출 비용을 줄이는 역할을 합니다.
- 에필로그 융합(Epilogue Fusion)
- — 행렬 곱셈 결과에 이어지는 bias add, 활성화 함수, 재스케일링 같은 연산을 별도 커널로 실행하지 않고 GEMM 커널 내부에 결합하는 최적화입니다. 중간 결과를 메모리에 기록했다가 다시 읽는 과정을 줄여 메모리 대역폭과 커널 실행 비용을 아낍니다.
- RMA 윈도(RMA Window)
- — 분산 프로세스가 상대 프로세스의 메모리를 직접 읽거나 쓸 수 있도록 제공하는 원격 메모리 접근 인터페이스입니다. 모든 rank가 같은 collective 호출에 참여해야 하는 방식과 달리 필요한 rank만 데이터를 가져오거나 전송할 수 있어 embedding 조회와 expert routing 같은 불규칙한 접근에 적합합니다.
- 대칭 메모리(Symmetric Memory)
- — 분산 환경에서 여러 rank가 대응되는 메모리 주소 구조를 공유하도록 할당한 메모리입니다. PyTorch 2.14에서는 CUDA graph 안에서 사용할 수 있고 peer 메모리를 동기화 없이 읽는 get 연산도 제공해 all-gather보다 작은 데이터 이동으로 처리할 수 있는 기반을 마련합니다.
- AOTInductor
- — PyTorch 모델을 미리 컴파일해 배포 가능한 실행 산출물로 패키징하는 컴파일 경로입니다. 외부 weight 메모리와 pinned 비동기 복사를 활용하면 여러 모델 컨테이너가 같은 GPU weight를 공유하거나 모델 교체 중에도 실행 중인 GPU 작업과 데이터 전송을 겹칠 수 있습니다.
기술
- PyTorch 2.14
- NVGEMM
- CuTeDSL
- CUTLASS
- Triton
- ATen
- Inductor
- torch.compile
- torch.export
- make_fx
- torch.switch
- torch.while_loop
- nccl2
- torchcomms
- Gloo
- DTensor
- NCCL
- NVSHMEM
- TokenSwitch
- AOTInductor
- Helion
- MPSGraph
- Metal
- Metal Performance Primitives
- ROCm 7.14
- TheRock
- Intel XPU
- CUDA Graphs
- cuBLASLt
- Composable Kernel
- Origami
- FlexAttention
- Python 3.15
- torchvision 0.29.0
활용 사례
- 대규모 multi-node 분산 학습에서 node 장애 후 process group을 재구성하는 fault-tolerant training
- Mixture-of-Experts 모델의 token dispatch와 expert output combine
- Apple Silicon에서 attention, autoregressive decode, SVD, QR, Cholesky를 포함한 학습·추론
- 가변 batch와 sequence dimension을 사용하는 모델의 torch.compile·torch.export·make_fx 통합
- 여러 AOTInductor 모델이 동일한 GPU weight를 공유하는 모델 serving
- CUDA graph 안에서 symmetric memory와 runtime-dependent while loop를 함께 사용하는 분산 추론
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.