본문으로 건너뛰기

PyTorch 중국 콘퍼런스, 개방형 AI 스택 확장

PyTorch Conference China 2026에서 새 회원 합류와 이기종 AI 인프라 통합 전략이 공개됐습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

PyTorch Conference China 2026은 Shanghai에서 PyTorch, 모델, 분산 학습, 추론, 하드웨어, 클라우드 인프라, 에이전트를 잇는 오픈 소스 AI 스택을 논의한 행사입니다. PyTorch Foundation은 Alibaba Cloud, Ant Group, Cambricon을 새 회원으로 맞이하고, Any Model·Any Chip·Any Cloud·Any Agent라는 협력 구도를 공개했습니다. 이기종 가속기 지원을 위해 디바이스 독립 API, 저장소 간 CI, 디바이스 인식 테스트, 플랫폼 인큐베이션 절차를 추진하며 하드웨어 통합 비용을 낮추려는 작업도 공유했습니다. DeepSeek-R1 사례에서는 같은 GB300 하드웨어에서 최적화 후 처리량 2.77배와 토큰 비용 60% 감소가 제시됐고, 중국에서 개발된 오픈 웨이트 모델의 OpenRouter 토큰 트래픽 비중은 2024년 말 2%에서 2026년 4월 45%로 증가한 것으로 소개됐습니다.

섹션별 상세

01
PyTorch Conference China 2026은 9월 8~9일 Shanghai에서 KubeCon + CloudNativeCon, OpenInfra Summit과 함께 열렸고, 9월 7일 공동 개최 행사로 시작됐습니다. 발표 범위는 모델과 PyTorch부터 분산 학습, 추론, 하드웨어, cloud native 인프라, agents까지 이어졌으며 연구 실험을 production 환경으로 연결하는 경로가 중심에 놓였습니다. 여러 오픈 소스 계층을 한 행사에서 연결한 구성은 AI 시스템을 단일 모델이 아니라 하드웨어와 운영 인프라까지 포함한 전체 스택으로 다루려는 방향을 드러냅니다.
02
PyTorch Foundation은 Alibaba Cloud, Ant Group, Cambricon을 새 회원으로 맞이했습니다. Alibaba Cloud는 Platinum Member로 Qwen model family와 cloud infrastructure에 참여하고, Ant Group은 Gold Member로 financial-services 규모의 production AI 경험을 보탭니다. Cambricon은 Platinum Member로 합류했으며 MLU accelerator와 “Upstream First” 방식의 PyTorch 기여를 기반으로 torch.compile, Eager Operators, Device Runtime, Distributed Computing, AMP, Dataloader, Profiler까지 작업 범위를 넓혔습니다.
Alibaba Cloud, Ant Group, Cambricon의 PyTorch Foundation 신규 회원 합류를 회원 등급과 함께 보여주는 인포그래픽입니다.
Infographic이미지는 세 신규 회원의 역할과 등급을 한 화면에 배치합니다. Alibaba Cloud와 Cambricon은 Platinum Member, Ant Group은 Gold Member로 표시되며 Alibaba Cloud에는 Cloud·Qwen model family, Ant Group에는 financial-services scale의 production AI, Cambricon에는 MLU accelerators와 upstream 기여가 연결돼 있습니다. 본문에서 발표한 회원 확대가 기업명과 참여 영역으로 시각화돼 있습니다.
03
재단이 공개한 오픈 소스 AI 스택은 모델과 지능 구축 계층, AI workload 실행·확장 계층, 인프라·격리 계층, heterogeneous compute 계층으로 이어집니다. PyTorch, vLLM, Ray는 지능 구축과 전달을 맡고 Kubernetes, KServe, Kueue, OpenTelemetry, llm-d는 workload 실행과 확장을 지원하며 OpenStack과 Kata Containers는 인프라와 격리를 담당합니다. 이 소프트웨어 계층은 NPU, CPU, GPU 및 기타 가속기에서 작동하고, 회원사들은 Any Model·Any Chip·Any Cloud·Any Agent라는 네 영역에 걸쳐 여러 계층을 함께 구성합니다.
PyTorch Foundation 회원이 Any Model, Any Chip, Any Cloud, Any Agent 네 영역에서 AI를 구축하고 제공하는 구조를 나타낸 도식입니다.
Diagram도식은 AI labs와 builders, silicon과 systems, clouds와 platforms, production과 services를 네 축으로 나눕니다. 각 축에는 Meta, Google, NVIDIA, AMD, AWS, Microsoft, Alibaba Cloud, Ant Group 등 회원사가 배치돼 하나의 조직이 전체 시스템을 독점적으로 구성하기보다 여러 회원이 계층을 가로질러 참여하는 구조를 나타냅니다. 본문에서 말한 개방형 AI 스택과 회원사의 역할 분담을 직접 연결하는 자료입니다.
04
중국 커뮤니티의 참여 규모로는 40개 이상 affiliated organizations에서 100명 이상의 중국 기반 개발자가 PyTorch에 기여하고, 중국 내 250개 이상의 조직이 DeepSpeed, Helion, PyTorch, Ray, Safetensors, vLLM 프로젝트에 기여하는 수치가 제시됐습니다. DeepSeek-R1 사례에서는 kernel, routing, parallelism, serving을 최적화해 동일한 GB300 하드웨어에서 2.77배 처리량과 60% 낮은 token cost를 기록한 구성이 소개됐습니다. 또 중국에서 개발된 open-weight models가 OpenRouter token traffic에서 차지하는 비중이 2024년 말 2%에서 2026년 4월 45%로 늘어난 사례가 오픈 모델 생태계의 확장을 뒷받침했습니다.
중국 내 PyTorch 개발자와 참여 조직 규모, PyTorch Foundation 회원 구성을 요약한 China in the Stack 인포그래픽입니다.
Infographic이미지는 중국 기반 PyTorch 기여자가 100명 이상이고 affiliated organizations가 40개 이상이라는 수치를 크게 표시합니다. 오른쪽에는 Alibaba Cloud, Cambricon, Huawei가 Platinum, Ant Group이 Gold, Beijing Academy of Artificial Intelligence가 Associate 회원으로 정리돼 있습니다. 본문에서 제시한 중국 커뮤니티의 참여 규모와 재단 회원 구성이 한 화면에 함께 나타납니다.
05
AI 하드웨어가 다양해지면서 연산자, compiler, training·inference framework, 통신 계층마다 반복적인 통합 작업이 발생하는 문제가 제기됐습니다. PyTorch TAC Accelerator Integration Working Group은 Huawei와 Intel이 공동 의장을 맡아 표준 hardware onboarding 지침, cross-repo CI testing, generalized device-aware test suites, platform incubation workflows를 추진하고 있습니다. 이 작업은 refined device-agnostic APIs와 확장된 multi-backend test matrix를 통해 여러 가속기에서 PyTorch workload를 옮기고 성능을 조정하는 비용을 줄이는 데 초점을 둡니다.

용어 해설

이기종 컴퓨팅(Heterogeneous Computing)
GPU, CPU, NPU, XPU처럼 구조와 명령 체계가 다른 여러 가속기를 하나의 소프트웨어 환경에서 함께 사용하는 방식입니다. 하드웨어마다 연산자, 컴파일러, 통신 계층을 따로 맞춰야 하므로 통합 API와 공통 테스트 체계가 중요합니다.
디바이스 독립 API(Device-agnostic API)
특정 칩의 세부 구현에 종속되지 않고 여러 가속기에서 같은 방식으로 호출할 수 있게 만든 인터페이스입니다. 모델과 프레임워크 코드를 재사용하면서 백엔드별 구현만 교체할 수 있어 하드웨어 추가 비용을 낮춥니다.
PD 분리(PD Disaggregation)
대규모 추론 시스템에서 프리필 단계와 디코딩 단계를 서로 다른 자원이나 서버에서 처리하는 배치 구조입니다. 각 단계의 계산 특성에 맞춰 자원을 따로 확장할 수 있어 vLLM 기반 서빙의 처리량과 운영 효율을 높이는 데 활용됩니다.
오픈 웨이트 모델(Open-weight Model)
학습된 가중치를 공개해 사용자가 직접 내려받고 실행하거나 추가 최적화할 수 있는 모델입니다. 소스 코드 전체 공개와는 구분되며, 모델 배포 조건은 각 프로젝트의 라이선스와 정책에 따릅니다.
KEDA
Kubernetes 환경에서 이벤트나 작업량을 기준으로 애플리케이션의 파드 수를 자동 조정하는 컴포넌트입니다. 학습과 추론 요청량에 따라 자원을 늘리거나 줄이는 자동 확장 구조에 사용되며, 기사에서는 Kubernetes 기반 AI 워크로드와 함께 언급됩니다.

기술

  • PyTorch
  • vLLM
  • Ray
  • Kubernetes
  • KServe
  • Kueue
  • OpenTelemetry
  • llm-d
  • OpenStack
  • Kata Containers
  • DeepSpeed
  • Helion
  • Safetensors
  • Karmada
  • SGLang
  • KEDA
  • torch.compile

활용 사례

  • 여러 GPU·NPU·XPU에서 PyTorch 모델을 학습하고 추론하는 이기종 AI 인프라
  • Kubernetes와 KEDA를 이용한 학습·추론 workload 자동 확장
  • vLLM과 llm-d를 활용한 대규모 모델 production serving
  • Qwen과 DeepSeek-R1 같은 모델의 kernel·routing·parallelism 최적화
  • 클라우드와 가속기 종류가 다른 환경에서 공통 PyTorch API와 CI로 모델 이식
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 10.수집 2026. 09. 10.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.