챕터별 상세
병렬 처리의 필요성과 계층 구조
HBM(High Bandwidth Memory)은 GPU 내부의 고속 메모리이며, NVLink는 GPU 간의 고속 연결 인터페이스이다.
Collective Operations: 분산 프로그래밍의 기초
Rank는 각 GPU 장치의 고유 식별 번호이며, World Size는 전체 참여 장치의 개수를 의미한다.
하드웨어 토폴로지와 통신 대역폭
RDMA는 네트워크를 통해 한 컴퓨터의 메모리에서 다른 컴퓨터의 메모리로 CPU 개입 없이 데이터를 직접 전송하는 기술이다.
데이터 병렬 처리 (Data Parallelism)
DDP(Distributed Data Parallel)는 PyTorch에서 제공하는 대표적인 데이터 병렬 처리 라이브러리이다.
텐서 병렬 처리 (Tensor Parallelism)
Megatron-LM 아키텍처에서 제안된 방식이 현대 LLM 학습의 표준 텐서 병렬화 기법으로 쓰인다.
파이프라인 병렬 처리 (Pipeline Parallelism)
파이프라인 버블은 앞 단계의 연산이 끝나기를 기다리는 대기 시간을 의미한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
