TL;DR
Red Hat과 Hugging Face가 Bengaluru에서 170명 이상의 학생·엔지니어·연구자·오픈소스 기여자를 대상으로 PyTorch와 대규모 ML 시스템을 다루는 기술 행사를 열었습니다. 발표는 PyTorch profiling, SGLang 기반 LLM inference, OpenEnv와 Repo2RLEnv를 활용한 RL environment, DeviceMesh·DTensor·FSDP2를 이용한 composable distributed training, zero-copy GPU 통신으로 이어졌습니다. 각 주제는 모델 사용법보다 profiler, runtime, kernel, reward infrastructure, sharding, communication layer를 직접 만드는 역량에 초점을 맞췄습니다. 행사의 핵심 메시지는 인도가 AI 소비자를 넘어 open ML stack의 builder와 maintainer로 참여해야 하며, 이런 시스템 계층의 기여가 모델 규모 확대를 뒷받침한다는 점입니다.
섹션별 상세
torch.profiler.record_functionPyTorch profiler에서 측정하려는 코드 영역을 표시하는 데 사용하는 API입니다.
torch.profiler.profilePyTorch 실행을 감싸 CPU와 GPU 작업을 수집하고 trace와 집계 결과를 생성하는 profiler API입니다.
Repo2RLEnv공개 repository를 검증 가능한 RL environment로 변환하는 방향을 가리키는 이름입니다.




용어 해설
- RadixAttention
- — SGLang이 요청에서 반복되는 prefix의 KV cache를 radix tree 구조에 저장하고 LRU 방식으로 재사용하는 메커니즘입니다. 공유 prompt와 높은 동시 요청 환경에서 중복 계산을 줄여 serving 효율을 높이는 데 쓰입니다.
- KV 캐시(KV cache)
- — LLM이 이전 token의 Key와 Value 상태를 저장해 다음 token 생성 때 다시 계산하지 않도록 하는 메모리 구조입니다. Decode 단계에서는 이 캐시를 반복적으로 읽고 갱신하는 비용이 커져 메모리 대역폭과 serving 성능에 영향을 줍니다.
- DeviceMesh
- — 여러 장치를 n차원 토폴로지로 표현해 data parallelism, tensor parallelism 같은 병렬화 축을 하나의 구조로 관리하는 PyTorch 추상화입니다. 장치 배치와 병렬화 차원을 명시적으로 다뤄 분산 학습 구성을 조합하기 쉽게 만듭니다.
- DTensor
- — 분산된 장치 배치 정보를 tensor의 의미에 포함하는 PyTorch 추상화입니다. DeviceMesh 위에서 tensor의 placement를 표현해 여러 병렬화 방식과 sharding을 조합할 수 있지만, 글에서는 eager-mode overhead와 불완전한 operator coverage를 제약으로 제시합니다.
- OpenEnv
- — LLM post-training을 위한 RL environment의 공통 형태를 정의하는 접근입니다. MCP로 tool을 노출하고 task와 reward rubric을 제공한 뒤 TRL 같은 training library에 연결해 환경 구축을 일회성 코드가 아닌 재사용 가능한 구성 요소로 바꿉니다.
- Zero-Copy 통신(Zero-Copy Communication)
- — GPU 간 데이터 전송에서 불필요한 중간 복사 단계를 제거해 통신 경로의 thread와 copy 비용을 줄이는 방식입니다. PyTorch의 분산 통신 계층에서 medium-message 구간과 대규모 학습의 통신 효율을 높이는 저수준 최적화로 다뤄집니다.
기술
- PyTorch
- Hugging Face
- Red Hat
- torch.profiler.record_function
- torch.profiler.profile
- SGLang
- Transformers
- RadixAttention
- Hugging Face Kernels
- RLHF
- OpenEnv
- MCP
- TRL
- Repo2RLEnv
- DeviceMesh
- DTensor
- FSDP2
- c10d
- GPUDirect RDMA
- NVLink
활용 사례
- 대규모 LLM inference serving
- 공유 prompt가 많은 동시 요청 처리
- programmatically verifiable reward 기반 LLM post-training
- repository와 test를 활용한 coding RL environment 구축
- DeviceMesh 기반 multi-dimensional distributed training
- zero-copy GPU-to-GPU communication
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.